📰 Data mart vs semantic layer when do you need both
🔗 https://medium.com/@kausik.kb.bhowmik/data-mart-vs-semantic-layer-when-do-you-need-both-ae625db547ad
💡 Прежде чем покупать semantic layer, найди, где команды втихую переопределяют метрики; начни с одной спорной.
📰 Ontology semantic layers and the ai enabled bi stack
🔗 https://medium.com/data-science-collective/ontology-semantic-layers-and-the-ai-enabled-bi-stack-b976b5f9c833
💡 Для conversational BI сначала резолви термины в governed-объекты, потом генерируй SQL: точность растёт с 46-58% до 68-89%.
📰 From Messy Data Models to Agentic Data Catalogs: Building an AI Data Architect with OKF and Gemini
🔗 https://medium.com/google-cloud/from-messy-data-models-to-agentic-data-catalogs-building-an-ai-data-architect-with-okf-and-gemini-75a20caee9ed
💡 Держи каталог как markdown в git со ссылками-lineage: агенту с одним read-tool хватает, чтобы обойти зависимости.
📰 Что российские BI-вендоры называют AI-агентом? Мы проверили 11 решений и собрали целый зоопарк
🔗 https://habr.com/ru/articles/1079844/
💡 Пилотируй AI-BI на 30-50 реальных вопросах с плохими данными и «не знаю»; семантический слой важнее размера LLM.
📰 Как мы мигрировали 40 кластеров ClickHouse: стратегии, проверки и автоматизация
🔗 https://habr.com/ru/companies/mindbox/articles/1078822/
💡 Переноси replicated-кластеры через новую реплику, не через снапшоты; проверяй тяжёлыми продовыми запросами до cutover.
📰 Как мы сделали RAG, который почти не галлюцинирует
🔗 https://habr.com/ru/companies/rwb/articles/1079316/
💡 Вкладывайся в retrieval-цепочку (перефраз, гибрид, RRF, cross-encoder): 85-90% против 60-70% у голого вектора.
📰 От исходных данных до аналитической витрины: что происходит между ними
🔗 https://habr.com/ru/articles/1080488
💡 Считай витрину готовой, когда любую цифру можно развернуть до исходной записи, а не когда графики открылись.
📰 Не пишите свой маленький BI
🔗 https://habr.com/ru/companies/diasoft_company/articles/1080808/
💡 Когда «пара графиков» требует фильтров, RBAC и экспорта, встраивай готовый BI-слой, а не выращивай свой.
📰 Why AI Hallucinations Are a Quality Engineering Problem
🔗 https://dzone.com/articles/ai-hallucinations-quality-engineering-problem
💡 Заведи галлюцинации как класс дефектов: ground-truth тесты, проверка консистентности, adversarial-пробы.
📰 What Is Changing in Enterprise Data Engineering?
🔗 https://dzone.com/articles/enterprise-data-engineering-changes
💡 Делай лёгкий transform до загрузки (EtLT), бизнес-семантику после; агенту нужен надёжный execution-слой.
📰 Rebuilding LinkedIn’s Follows Recommendations with LLM-Based Semantic Retrieval and Ranking
🔗 https://www.linkedin.com/blog/engineering/ai/rebuilding-linkedins-follows-recommendations-with-llm-based-semantic-retrieval-and-ranking
💡 Переводи профили в нарративный промпт и эмбеддинг, дообучай bi-encoder на целевом действии; те же эмбеддинги отдай ранкеру.
Мы стараемся держать фокус канала на теме управления данными, но ИИ-повестка вытесняет её отовсюду, и из нашей ленты тоже. Но что чем дальше, тем очевиднее: в эпоху ИИ вопросы data management становятся не менее, а более острыми. Просто теперь потребитель данных другой.
Свежий репортаж ComNews с IT Elements-2026 это хорошо иллюстрирует. Пилоты ИИ-агентов показывают отличные результаты, а в промышленной эксплуатации ломаются. Причина не в моделях. Данные не находятся, приходят не вовремя, один и тот же показатель считается по разным методикам в разных подразделениях. Самая точная формулировка в материале: в пилоте аналитик фактически выполняет роль живого каталога, а в проде этого личного знания уже нет.
На самом деле человек всегда был буфером, который компенсировал недостаток качества данных (по нашему скромному мнению, тут можно не согласиться в комментариях). Он видел выбросы, узнавал сезонность, держал в голове корреляции с внешними факторами, которые находятся за рамками видимости базы данных. Алгоритмы намного чувствительнее к данным, чем люди, и этого буфера у них нет. Агент не заметит, что показатель посчитан по старой методике, и не спросит, почему он расходится с соседним отделом. Он быстрее выдаст одну из версий и пойдёт дальше.
Цифры из материала это подтверждают. По данным BPMSoft, 58% компаний внедряют или пилотируют ИИ, но только 20% считают свои данные готовыми к ИИ-сценариям. До реальной работы агентов на реальных данных, по оценке участников, дошли 10-20% компаний. Разрыв между этими цифрами и есть та самая работа, которую годами откладывали на потом.
Рецепт, который предлагают спикеры, не новый, и в этом его ценность. Дата-каталог с назначенными владельцами метаданных и согласованными корпоративными определениями показателей до подключения агента, а не после. Минимальные права доступа и журналирование действий, спроектированные вместе с каталогом, потому что агент над каталогом получает чтение практически всех данных компании и становится мишенью для промпт-инъекций. Метрика зрелости - time-to-data, время от бизнес-гипотезы до нужных данных у аналитика. Она измеряет организацию, а не модель, и поэтому честнее любых процентов внедрения.
Так что ИИ-повестка не вытесняет управление данными. Она наконец делает его обязательным. Все скучные вещи, которые не хотели финансировать ради людей, придётся сделать ради алгоритмов.
⚡️ Вышел отчет «Отечественные решения Data Lakehouse-круг Громова 2026»
Российский рынок Data Lakehouse перешёл от пилотных проектов к промышленным внедрениям. При этом рынок разделился на два архитектурных подхода, а информационная безопасность стала одним из главных критериев выбора платформы.
В исследование вошли 10 отечественных решений: MWS Data Lakehouse, Платформа Selena, Digital Q.DataFactory, CedrusData Platform, Data Ocean Nova, Tengri Data Platform, Arenadata Hyperwave, VK Data Platform, YTsaurus и Yandex Data Platform.
➡️ Отчёт даст ориентиры:
– чем отличаются интегрированные платформы от унифицированных систем,
– когда важнее гибкость и технологическая свобода, а когда – простота внедрения и сопровождения,
– какие компоненты и архитектурные подходы используют российские Data Lakehouse,
– на что обратить внимание при выборе платформы для корпоративного хранилища данных.
➡️ Особое внимание уделено:
– драйверам перехода на Data Lakehouse – почему технология становится востребованной и какие задачи заказчиков стимулируют её внедрение,
– информационной безопасности – RBAC, сквозному управлению доступом, аудиту и Data Lineage,
– S3-хранилищу, которое фактически становится фундаментом производительности Lakehouse,
– AI/ML и AI-агентам: полноценные агентные возможности на российском рынке пока остаются скорее исключением, чем стандартом.
📌 Исследование основано на сравнении технологических стеков, экспертной оценке решений и анализе практических сценариев их применения. Полный отчёт доступен на сайте центра «Круги Громова» – скачать бесплатно!
Получите актуальную картину российского рынка Data Lakehouse на 2026 год.
Круги Громова | Подписаться и стать частью Data-сообщества ⬅️
🚀 XI Форум «Управление данными — 2026». Присоединяйтесь к главной осенней встрече дата-профессионалов!
🔥 Регистрация
📍24 сентября в Москве (Radisson Blu Leninsky Prospect Hotel) и онлайн пройдет ключевое событие для CDO, ИТ-директоров, дата-инженеров, аналитиков и всех, кто строит цифровую экономику на данных.
Это уникальная площадка, где обсуждают реальные стратегии Data Management, качество данных и подготовку к ИИ-трансформации — без воды, только практика и опыт лидеров рынка.
🔥В программе:
• Data Governance 3.0 и архитектура данных для ИИ (включая Архитектурный баттл).
• Дискуссия «Миграция и импортозамещение — что дальше?» (Сбер, НСПК, СИБУР, ВТБ, Hoff).
• Отраслевые треки: Промышленность, Ретейл, Телеком, Финансы и Страхование.
• Реальные кейсы от «Газпром нефти», МТС, Т-Банка, Альфа-Банка, ОКБ и др.
💡 Вы узнаете, как выстроить культуру работы с данными, перейти от хаоса к дата-продуктам и оценить эффективность Data-проектов.
📍 Москва + онлайн-трансляция + записи докладов
🎟 Приглашаем присоединиться лично или онлайн!
🔗 Регистрация
👉 Подробнее о форуме
📲 Будьте в курсе обновлений в чатах форума:
• MAX: https://go.osp.ru/am
• Telegram: telemetr.me/dm20xx