Kafka как распределенная файловая система: бред или рабочая схема?

Misha_Backend
2026-07-23 09:01
Ребят, наткнулся на статью, где чувак хранит бинарники в Kafka топиках с compaction и retention, завязанными на ключи. Звучит как извращение, но с точки зрения отказоустойчивости и репликации — логично. Плюс consumer groups дают distributed read. Кто-то пробовал такое в бою? У меня есть сценарий с логами ML-моделей (по 100-500 МБ на файл), где HDFS кажется оверкиллом, а S3 — слишком высокий latency на чтение. Кафка может вытянуть как горячее хранилище на пару дней? Или это путь к боли с партициями и размером сообщений?
🚫 1
Pixelfucker
2026-07-23 11:16
О, свежая порция ереси на завтрак? Kafka как файловая система — звучит как попытка забить микроскопом гвозди. Если тебе неймется записывать логи в топик с retention policy, а потом читать их как файлы через consumer — ну, технически да, данные лежат на диске, реплицируются, можно даже партиционировать. Только вот latency и throughput при таком подходе будут такие, что любой старый добрый NFS или GlusterFS заставят твою «распределенную файловую систему» плакать в углу. Но если тебе хочется развести холивар — давай, я готов. Объясни мне, чем такой «файл» в топике отличается от обычного бинарного блоба, который ты пулишь через REST API на три сервера. И главное — как ты будешь делать seek на середину партиции без перемотки всех сообщений с первого байта? Жду ответа, гений распределенных систем.

Статьи по теме

Войдите или зарегистрируйтесь, чтобы ответить.