Iceberg Lakehouse
Alex Merced RU

послесловие

Если прошедшее десятилетие было о том, чтобы сделать аналитику самообслуживаемой, то следующее будет о том, чтобы сделать её самоуправляемой. Звучит как небольшая смена формулировки, но это не так. «Самообслуживание» предполагает, что плоскостью управления по-прежнему остаются люди: мы замечаем неладное, разбираемся, чиним конвейер, добавляем защитный барьер, пишем разбор инцидента, держим контекст в голове. «Самоуправляемость» означает, что заметная часть этой работы переходит к агентам - системам, способным наблюдать за вашей платформой данных, предлагать изменения, выполнять процессы, проверять результаты и продолжать итерации.

Именно эта часть кажется визионерской, потому что она меняет саму суть вашей аналитической системы. Это уже не просто место, где люди задают вопросы. Это среда, где программы совершают действия.

И вот неудобная правда: большинство сегодняшних аналитических стеков оптимизированы под ответы на вопросы, а не под принятие ответственности. Они возвращают результаты. Но не гарантируют, что эти результаты будут воспроизводимы через неделю, объяснимы через квартал и безопасны для изменения через год. Слоем исправления ошибок были люди. Агенты им не станут - если только вы не построите систему так, чтобы «осторожно» было поведением по умолчанию.

На практике агентам, управляющим данными, нужна семантика, более близкая к базам данных, чем к файлам. Им нужна платформа, где данные трактуются как состояние, а не просто как blob-объекты в объектном хранилище. Они должны уметь уверенно ответить:

  • Что изменилось?
  • Когда это изменилось?
  • Почему это изменилось?
  • Каким было предыдущее состояние?
  • Можем ли мы безопасно откатиться?
  • Можем ли мы воспроизвести в точности тот набор данных, который лёг в основу этого отчёта, обучил ту модель или вызвал то оповещение?

Именно здесь табличные форматы и фундамент lakehouse перестают быть инфраструктурной мелочью и становятся стратегией. Форматы вроде Iceberg создавались не для того, чтобы ваши запросы стали на 3% быстрее. Они создавались, чтобы сделать данные читаемыми и управляемыми на масштабе: снимки, атомарные коммиты, эволюция схемы, эволюция партиционирования и слой метаданных, описывающий таблицу по мере её изменения во времени.

Эти метаданные и есть плоскость управления. Та часть, о которой агент может рассуждать. Сравнивать. Проверять. Действовать на её основе. Без догадок.

А теперь представьте, что происходит, когда агенты становятся доверенными операторами внутри системы вроде lakehouse. Агент замечает дрейф выше по потоку и предлагает точечную дозагрузку вместо пересчёта всего. Другой агент обнаруживает приближающееся изменение схемы, прогоняет проверки совместимости по всем нижестоящим потребителям и выкатывает миграцию со встроенным откатом. Агент управления затратами видит новый шаблон запросов, взрывающий расходы, рекомендует стратегию партиционирования, проверяет её на срезе данных и разворачивает постепенно. Агент качества следит за сигналами здоровья таблиц, изолирует подозрительные партиции и запускает переобработку только там, где нужно. А когда кто-то спрашивает: «Почему изменилось это число?» - агент выдаёт разницу между снимками, прослеживает происхождение данных и формирует объяснение, понятное человеку.

Если это похоже на SRE для данных - так и есть. В ближайшие десять лет лучшие платформы данных будут походить не столько на хранилища, сколько на промышленные системы: непрерывно сопровождаемые, непрерывно оцениваемые и непрерывно улучшаемые автоматическими операторами.

Поэтому «планировать до внедрения» - не просто приятная привычка в процессе. Так вы определяете пространство действий для агентов. Планирование - это то, где вы фиксируете, что агентам позволено менять, как изменения проверяются, что значит «хорошо» и что происходит, когда система ошибается. Без этого агенты всё равно будут вносить изменения - просто теми же беспорядочными способами, что и люди сегодня: разовыми скриптами, неучтёнными решениями и институциональной памятью, испаряющейся при переходе сотрудника в другую команду.

Следующее десятилетие выиграют не команды с самыми изысканными моделями. Его выиграют команды, чьи системы данных можно безопасно эксплуатировать на машинной скорости. Стройте аналитическую платформу так, будто у неё будут операторы, которые никогда не спят, - потому что так и будет. И тогда открытые табличные форматы и фундамент lakehouse перестанут казаться скучным выбором. Они окажутся тем, чем являются: субстратом, который делает автономность проверяемой, обратимой и заслуживающей доверия.

—Ади Полак
Эксперт по ИИ, облакам и данным
Автор книги Scaling Machine Learning with Spark
Соавтор книги High Performance Spark

Обновлено 26.07.2026