Мы полвека учились строить системы, которые живут годами. Похоже, следующие лет десять будем учиться строить системы, которые живут несколько минут.
После Big Data LDN хочу поделиться докладом Joe Reis "От машинерии данных к смыслу и агентности в AI-организациях".
Полный транскрипт и слайды - в комментарии, ниже мое самари и основные выводы.
Джо Райс - соавтор Fundamentals of Data Engineering (O'Reilly), ведущий The Joe Reis Show, "выздоравливающий data scientist" с 25 годами в индустрии.
Его главный тезис: индустрия данных четверть века улучшала машинерию - перемещение и хранение. Это сработало: хранить и гонять данные стало элементарно. Но почти ни одна компания не работает с данными хорошо, потому что узкое место никогда не было техническим. Оно организационное: владение, общий смысл, доверие.
Ключ к этому - закон Конвея 1968 года: система копирует коммуникационную структуру организации, которая её строит. Две команды не разговаривают друг с другом, у них разные определения одного и того же, и хранилище с пайплайнами в итоге повторяет оргструктуру.
Проблемы координации десятилетиями маскируются под проблемы данных. Теперь в эти человеческие проблемы сбрасывают AI. По его опросу, 69% говорят, что AI дисфункцию не уменьшил, а половина из них - что стало хуже.
Параллельно с данными сталкивается мир знаний: онтологии, семантика, графы знаний, контекст. Задача больше не в том, чтобы смоделировать базу данных. Нужно смоделировать достаточно большой кусок мира организации, чтобы машина могла о нём рассуждать.
Райс описывает, куда движутся инженеры в Google. Поднять Postgres на семь минут, собрать граф датасетов, материализовать результат в DuckDB, создать песочницу с нужными правами и уничтожить её. Это разворот на 180 градусов: мы привыкли строить долгоживущие распределённые системы, а агенту нужен черновик на время задачи.
Модели данных становятся такими же одноразовыми - строятся под задачу и разбираются после. Поэтому provenance и lineage должны стать объектами первого класса в метаданных, иначе через час никто не восстановит, откуда взялась цифра.
Облака когда-то превратили серверы из питомцев в эфемерное облако «по запросу». Агенты делают следующий шаг: одноразовыми становятся не только серверы, но и схемы, модели, скрипты, целые приложения под одну задачу. Стоимость создания кода и инфраструктуры стремится к нулю.
Стоимость ошибки в правилах вокруг них растёт.
Значит, долговечным остаётся не артефакт, а рамка вокруг него. Райс формулирует её через контракты: схема говорит агенту, как выглядят данные, семантика - что они значат, намерение - что с ними разрешено делать.
Инженер завтрашнего дня проектирует не пайплайны, а четыре вещи:
- реальность - что представлено в данных и модели;
- контекст - что агентам можно обнаружить, а что нельзя;
- границы - контракты, права, governance;
- среды исполнения - где агентам вообще разрешено работать, раз уж они научились сбегать из песочниц.
Код становится расходником. Смысл и правила становятся активом.
📰 Автоматизация Data Quality: как мы изменили подход к нашим инструментам
🔗 https://habr.com/ru/companies/tbank/articles/1085014/
💡 Отдай генерацию DQ-проверок агенту поверх каталога метаданных с обязательным HITL: 373 таблицы покрыты за три дня силами трёх стажёров.
📰 От сырых проверок качества данных до понятной картины в OpenMetadata
🔗 https://habr.com/ru/companies/magnit/articles/1085076/
💡 Интегрируя внешние DQ-проверки в OpenMetadata, ставь Kafka перед медленным API (около 1 с на запрос) и используй 409 как идемпотентность.
📰 Как устроена платформа данных «АстраЗенека» в России: BI, DWH и Data Lake в одном контуре
🔗 https://habr.com/ru/companies/astrazeneca/articles/1085060/
💡 Разводи запросы по контурам: официальная цифра - в DWH, гипотеза - в озеро, а приёмку работ делай через описание объектов в каталоге.
📰 VK Data Platform под капотом: как устроена платформа для Data Lakehouse
🔗 https://habr.com/ru/companies/vktech/articles/1086190/
💡 Выбирая Lakehouse, проверяй изоляцию compute-пулов над единым Iceberg-слоем, иначе тяжёлый Spark ETL будет тормозить BI.
📰 BI в эпоху ИИ: BI больше не нужен? Да здравствует BI
🔗 https://habr.com/ru/companies/luxms_bi/articles/1086568/
💡 Вкладывайся в обвязку, а не в модель: LLM - расходник, а права, семантика данных и аудит действий агента переживают любую смену модели.
📰 Data-driven или data-hopeful: зачем аналитике становиться системой
🔗 https://habr.com/ru/companies/garage8/articles/1086780/
💡 Оценивай аналитику матрицей зрелости по семи доменам и расти на одно деление за цикл, защитив 10-15% времени аналитиков.
📰 Data mart vs semantic layer when do you need both aedbad
🔗 https://medium.com/@kausik.kb.bhowmik/data-mart-vs-semantic-layer-when-do-you-need-both-ae625db547ad
💡 Прежде чем покупать semantic layer, напиши контракт на одну спорную метрику и прогони его параллельно со старой логикой.
📰 From Messy Data Models to Agentic Data Catalogs: Building an AI Data Architect with OKF and Gemini
🔗 https://medium.com/google-cloud/from-messy-data-models-to-agentic-data-catalogs-building-an-ai-data-architect-with-okf-and-gemini-75a20caee9ed
💡 Храни метаданные как Markdown в Git со ссылками-связями, и агенту хватит одного read-инструмента, чтобы трассировать lineage.
Роберт Солоу в 1987 году остроумно сформулировал парадок производительности:
You can see the computer age everywhere but in the productivity statistics.
Суть парадокса: технология может быть повсюду и при этом почти не отражаться в статистике производительности. Причина — не в самой технологии, а в том, что вокруг нее еще не перестроились инфраструктура, институты и организации. Весь свежий доклад McKinsey, по сути, — это объяснение, почему такой разрыв возникает и как его читать в случае ИИ.
Общие технологии (пар, электричество, интернет, теперь ИИ) не преображают экономику фактом изобретения. Нужны сопутствующие инновации, инфраструктура, правила, капитал и готовность людей менять способ работы — а эти части приходят не одновременно. Электричеству понадобилось физически перестроить заводы вокруг электромотора; интернету — построить сети, затем создать новые бизнес-модели, затем реорганизовать компании. Пик влияния на рост ВВП: пар — ~100 лет, электричество — ~40, компьютеры и интернет — ~25.
Центральная идея доклада — части системы движутся с несопоставимой скоростью:
• Возможности моделей растут экспоненциально (сложность задач удваивается ~каждые 4 месяца с 2023 г.).
• Физическая инфраструктура строится линейно, годами.
• Перестройка организаций идёт ещё медленнее и неравномерно.
Парадокс углубляется тем, что управление и безопасность отстают от внедрения: только ~30% организаций достигли зрелого уровня AI-управления, треть не проверяет системы на безопасность перед запуском, ответственность размыта между IT, юристами, HR и риском. А крупный сбой (кибератака или провал управления) способен вызвать откат и ужесточение регулирования, что затормозит отдачу ещё сильнее.
Подробнее читать в источнике: The AI economy: Interconnected forces, feedback loops, and speeds of change
September 10, 2026 | Discussion Paper
1990-е - раз в неделю ты идешь через весь город к маме на работу, потому что у нее в отделе есть 1 компьютер и в перерыв ты играешь в Prince of Persia. в другие дни играют другие дети...
2026 - GPT-6 сделай клон Prince of Persia
html файл с игрой в комментарии - можно скачать
P.S. а Anthropic сбросили лимиты. привет Fable 5.1