Iceberg Lakehouse
Alex Merced RU

предисловие

Apache Iceberg решает проблему, которой почти 50 лет, - она родилась во времена, когда вычислительная техника выглядела совсем не так, как сегодня. Не было интернета. Не было ноутбуков. Мы только начинали догадываться, во что могут превратиться персональные компьютеры. Тогда это было трудно понять, но долгое правление мейнфреймов приближалось если не к концу, то по меньшей мере к своей середине. Базы данных, прежде централизованные, оказались разбросаны по всему предприятию.

Как только вычисления подешевели настолько, что полезную машину стало можно поставить на каждый рабочий стол, стало экономически оправданно ставить компьютер и под каждый стол. Зарождавшаяся в конце 80-х и начале 90-х клиент-серверная архитектура взяла данные, некогда централизованные в мейнфрейме, где приложения и отчётность могли работать с одними и теми же данными, и рассеяла их по десяткам и сотням департаментских баз данных, физически и логически разбросанных по сложным глобальным организациям. Увидеть состояние всё более компьютеризированного бизнеса в одном месте стало невозможно.

И тут появляется Билл Инмон со своей новаторской работой 1992 года Building the Data Warehouse. Родилась новая аналитическая архитектура, призванная навести порядок в том благотворном хаосе, который развязала клиент-серверная эпоха. Билл ясно увидел, что данные существуют в двух ипостасях: операционной, где приложения выполняют транзакции в базах данных, отражающие обмен ценностью между бизнесом и его клиентами, и аналитической, где лица, принимающие решения, пытаются понять, что все эти транзакции значат. Это было полезное разграничение двух видов доступа к данным с радикально разными эксплуатационными характеристиками. А ещё это был инструмент воссоединения корпоративных данных. Операционная ипостась оказалась раздроблена под давлением заманчивой экономики клиент-серверной парадигмы, и хранилище данных, наполняемое тщательно спроектированными ETL-процессами, вернуло всё состояние бизнеса под единое стекло, на которое руководители могли смотреть и по которому могли действовать.

Сторонники клиент-серверной революции оказались теми же людьми, которые всего несколькими годами позже построили бурно растущий интернет. И хотя возможности клиента деградировали до уровня веб-браузеров первого поколения (которым было не тягаться с богатой экосистемой тогдашних компонентов Visual Basic), приложения и архитектура данных десятилетие оставались практически неизменными. Один лишь интернет не сломал хранилище данных - для этого понадобились смартфоны. Как только доступ в интернет переехал из гостиных в наши карманы и всё большая часть коммерческой и социальной жизни стала опосредована цифровыми технологиями, приложения и архитектуры данных 80-х наконец созрели для слома.

Данные вступили в подростковый возраст вместе с Hadoop и эпохой больших данных. Вместо одиночных серверов с реляционными базами, обслуживавших хранилища данных 90-х, мы стали строить кластеры распределённого хранения и вычислений, чтобы справляться с объёмами данных, которые давал нам новый мир. Но, как и бунтующие подростки, уверенные, что уж мы-то, на самом краю истории, во всём разобрались, мы сделали несколько сомнительных выборов. Измотанные тем, сколько времени и сил уходило на превращение операционных баз данных в специализированные схемы, нужные хранилищу, мы решили выбросить схему вовсе и свалить все источники данных, сырые и необработанные, в «озеро данных». Транзакции, как нам говорили - и я лично один из тех, кто это говорил, - просто не могут существовать на таком масштабе, по крайней мере если вы хотите выполнять больше нескольких штук в секунду.

Понадобилось всего несколько лет расточительной жизни, чтобы мы осознали: нам всё-таки нужно, чтобы наши базы данных вели себя как базы данных. Пришли поставщики облачных хранилищ данных и предложили нам схемы и транзакции - а заодно и такие «возможности», как привязка к вендору и высокая стоимость. И только в 2017 году, когда Райан Блю и Дэниел Уикс создали Iceberg, аналитика начала входить во взрослую жизнь. Теперь у нас была система, способная вместить масштаб современных систем данных, работать нативно в облаке, поддерживать конкуренцию между поставщиками хранилищ и вычислений и дать нам поддержку табличных схем и транзакций - тех самых, от которых мы совсем недавно отказались, в подростковом раздражении вырываясь из унаследованных архитектур данных в облако. С Iceberg аналитика наконец повзрослела.

Я не могу представить себе никого, кто рассказал бы нам, что это за технология и как она работает, лучше Алекса Мерседа, посвятившего целый период своей карьеры именно этой задаче. Он выдающийся преподаватель и эксперт не только в предмете, но и в самом процессе - в том, как помочь непосвящённым вроде нас понять, что делает Iceberg и почему это важно. Если ваша цель - разобраться в современном состоянии data lake, читайте дальше.

—Тим Берглунд
VP Developer Relations, славный малый
Confluent

Обновлено 26.07.2026