📰 How We Refresh Razorpay's Data Warehouse 10x Faster with Graphs and Indexes
🔗 https://engineering.razorpay.com/how-we-refresh-razorpays-data-warehouse-10x-faster-with-graphs-and-indexes-538abc244703
💡 Вывод: при полном пересчёте витрин на больших джойнах (30+ таблиц) выигрыш даёт не оптимизация самого джойна, а смена модели: описать витрину как граф зависимостей и обновлять только затронутые ветки через вторичные индексы на озере - так Razorpay убрала зависимость от TiDB для исторических данных и сократила компьют на порядок.
📰 How Cerebras Built Its Enterprise Knowledge Base
🔗 https://www.cerebras.ai/blog/how-we-built-our-knowledge-base
💡 Вывод: рабочая база знаний строится не на единой "истине", а на прямой выгрузке из мест, где данные и так живут (Slack, код, доки), с дистилляцией сырых тредов в LLM-нормализованные документы перед эмбеддингом - сырой транскрипт для поиска хуже, чем его выжимка.
📰 DATA MANAGEMENT IN THE AGE OF AI
🔗 https://williaminmon.substack.com/p/data-management-in-the-age-of-ai
💡 Вывод: в мире генеративного ИИ управление данными теряет прямой контроль (правки в базе) и переходит к косвенному - фильтрации того, что вообще попадает в LLM; ключевая задача смещается с моделирования структурированных схем на постоянную актуализацию онтологии/таксономии для неструктурированного текста.
📰 Scaling Grab's Data Lake: Our journey to Apache Iceberg adoption
🔗 https://engineering.grab.com/our-journey-to-apache-iceberg-adoption
💡 Вывод: миграция на Iceberg окупается не сама по себе, а через конкретные узкие места (Z-ordering сократил запрос с 70 до 6 секунд, API-costs на одной таблице упали на 95%); при этом мигрировать нужно точечно - по частоте сканирования и стоимости API, а не всё озеро разом.
📰 Why We Moved from Hive-Style Data Lakes to Apache Iceberg?
🔗 https://medium.com/@rongalinaidu/why-we-moved-from-hive-style-data-lakes-to-apache-iceberg-f9f23e7a64d3
💡 Вывод: сила Iceberg не в замене Parquet, а в отвязке метаданных от файловой структуры (S3 LIST на 50k файлов = 50 запросов только на discovery) и в column ID вместо имени/позиции колонки - это единственное, что делает эволюцию схемы безопасной без переписывания истории.
Редакция понимает, что достала всех со совим Netlix, но посмотрите что они написали опять в своем блоге!
Блог это на самом деле только вершина айсберга и краткое изложение, но там есть сслыка на их научную публикацию со всеми деталями - там они рассказали о разработке модели поведения пользователей, выбора фильмов и персонализированных рекомендаций.
Эта модель позволяет оценить, как рекомендации влияют как на решение пользователей о просмотре, так и, в случае положительного решения, на выбор конкретных фильмов.
Другими словами решают очень сложную задачу - доказывают, что модель рекомендаций работает.
Думаю те, кто сталкивался с разработкой рек моделей знаю, что "выделить" степень влияния на целевое действие именно элемента рекомендации и отделить его от "шума" личных предпочтений и общих трендов - довольно сложно.
В общем для тех, что занимает рек системами имхо must have почитать!
CleverData внедрила LANDEV AI для единого и безопасного доступа к языковым моделям
Вместо прямых подключений к каждому провайдеру сотрудники компании теперь обращаются к моделям через единый шлюз, который дает стабильный, безопасный и экономически управляемый доступ к широкому спектру LLM-моделей через общий программный интерфейс (API).
Клуб CDO в альянсе с Ассоциацией больших данных выступил партнером исследования NEXT CDO, организованного HeadExpert. Отчет был представлен на Data Day 2026, партнерами также выступали Aston и DECO Systems.
Коллеги, зрелость функции данных сегодня определяется уже не размером команды и количеством витрин.
Компания может иметь современную платформу и при этом вручную разрешать споры о показателях. Может быстро запускать AI-пилоты, но не закреплять владельца бизнес-эффекта. Может развивать self-service и одновременно получать несколько версий одной управленческой цифры.
Индекс nCDO помогает увидеть такие разрывы. Он оценивает пять областей:
- стратегию и экономику;
- модель управления данными;
- платформу и доверие;
- готовность к ИИ и продуктам решений;
- лидерство и культуру.
Всего — 13 способностей по шкале от 0 до 4. Главный результат диагностики — не место в рейтинге, а понимание следующего шага: что сегодня сильнее всего ограничивает эффект функции данных.
Предлагаем пройти самодиагностику и обсудить результаты внутри сообщества: какая область сегодня требует наибольшего внимания в вашей компании?
Полный отчет NEXT CDO / Рассчитать свой индекс nCDO: https://next-cdo.headexpert.org