🙂 Яндекс открыл LLM, обученную с нуля: модель обгоняет решение NVIDIA в коде
Alice AI Foundation LLM обучена на данных Яндекса без инициализации чужими открытыми весами. Претрейн распространяется под лицензией Apache 2.0, что позволяет использовать решение в коммерческих и исследовательских целях, дообучая под свои задачи.
Модель — экспериментальная ступень на пути к единой рассуждающей модели (ЕРМ): на ней Яндекс проверяет архитектурные решения, а сама ЕРМ станет основой агентных возможностей Алисы AI.
🟡 Архитектура
Модель построена на MoE: из 80 млрд параметров в моменте активны только 3 млрд. Она уже прошла основной этап обучения, поэтому её можно использовать как основу для собственных проектов.
🟡 Качество
По данным тестов:
🟢 в написании кода модель обгоняет решение от NVIDIA;
🟢 в олимпиадных задачах по математике делит лидерство с моделью от Alibaba;
🟢 при меньшем размере превосходит DeepSeek в задачах, требующих широких фактических знаний.
С предыдущей моделью компании, Alice AI LLM 235B, новая версия выигрывает в 75% случаев на фактологических вопросах, хотя у той втрое больше параметров и всемеро больше активных. С длинными текстами до 128K токенов модель работает на уровне лидеров рынка, разделяя первенство с DeepSeek.
🟡 Бенчмарки
Чтобы проверять знания, важные именно для русскоязычной аудитории, компания подготовила два собственных набора: WikiWebFacts построен на Википедии, HardMultiQA — на данных запросов пользователей к Алисе AI. Вместе с задачами опубликованы эталонные ответы и протокол оценки.
🟡 Обучение
Команда добилась, чтобы видеокарты не простаивали в ожидании данных, и один из этапов обучения стал быстрее примерно вдвое. Оптимизация хранения промежуточных данных втрое снизила потребление видеопамяти.
Раньше отбор обучающих текстов обходился более чем в 200 тыс. часов работы видеокарт. Теперь документы сначала проходят через предварительные фильтры, и до ресурсоёмкой проверки доходят уже отобранные. Вычислений требуется в десятки раз меньше, а полезных документов сохраняется около 95%.
Ещё один вывод касается масштабирования: насколько точно удаётся предсказать, какая модель окажется лучше, зависит от того, на каких данных их сравнивать. На случайном наборе точность такого прогноза 42%, на специально подобранном — 87–94%.
Модель, технические отчёты и бенчмарки доступны на Hugging Face, техрепорт опубликован на Хабре.
✔️ США предложили Китаю горячую линию для инцидентов с ИИ
Министр финансов США обсудил с вице-премьером Китая создание диалога по ИИ и механизма взаимного оповещения. Стороны будут предупреждать друг друга об инцидентах с ИИ, которые угрожают национальной безопасности.
Что именно считать таким инцидентом, пока не ясно. Агентство Синьхуа подтвердило, что вопросы ИИ обсуждались, но не сообщило, принял ли Пекин предложение. Тему дополнительно разовьют президент США и Председатель КНР на саммите в Вашингтоне на этой неделе.
apnews.com
✔️ Anthropic, OpenAI, Google и SpaceXAI обвинили в картельном сговоре
Подписчики ИИ-сервисов подали коллективный иск против четырёх компаний в федеральный суд Калифорнии. Поводом стало эссе гендиректора Anthropic Дарио Амодеи с призывом ограничить темпы неконтролируемого развития ИИ. Идею поддержали основатель Илон Маск, Сэм Альтман и Демис Хассабис.
Истцы считают это сговором конкурентов в нарушение первой статьи закона Шермана: пользователи платят прежнюю цену за продукты, которые улучшаются медленнее, чем при свободной конкуренции. Они просят придать иску статус коллективного, запретить координацию и признать её незаконной.
bloomberglaw.com
✔️ SpaceXAI выпустила Grok 4.7
Новинка построена на более крупной базовой архитектуре, лучше проверяет собственные решения и удерживает длинный контекст, а также обучена работать в обвязке Grok Bot.
На CursorBench 4.0 модель лучше чем Grok 4.6, GPT-5.6 Sol, но не дотягивает до Fable 5.1. Защитные механизмы переписаны заново - снижено количество ложных отказов при работе с кодом, усилена защита от джейлбрейков в сферах биобезопасности и кибербезопасности.
Grok 4.7 доступна в Cursor, Grok Build, через API и сторонние платформы. Цена как у Grok 4.6: 2 доллара за млн входных и 6 долларов за млн выходных токенов. Вариант с вдвое более быстрой генерацией стоит вдвое дороже.
x.ai
✔️ ByteDance запустила платформу для производства коротких сериалов
BytePlus, корпоративное подразделение ByteDance, анонсировала Dramagic. Платформа ведёт проект от разбора сценария и настройки персонажей и локаций до раскадровки и превью видео. Облик героев и окружения сохраняется между сценами, а над проектом может работать команда.
Доступ открыт по запросу. Тариф Basic стоит 600 долларов в год и даёт 60 тысяч баллов на год, это около 44 минут видео в 720p.
BytePlus в X
✔️ Reve закрывает генератор изображений
Стартап отключит 27 сентября возможность создания изображений и видео в своем сервисе reve.com. Регистрацию и оформление подписок остановили в четверг на прошлой неделе. Скачать созданное можно до 31 октября, деньги за сентябрь платным подписчикам вернут к середине октября.
Ранее Reve объявила об инвестициях от OpenAI. Часть команды стартапа переходит в OpenAI работать над мультимодальными моделями, сама Reve остаётся независимой.
Сооснователь Reve Кристиан Кантрелл объяснил, что студия уходит от креативных инструментов к другим ИИ-сценариям автоматизации.
reve.com
Почему одни ИИ-агенты помогают разработчикам экономить время, а другие требуют постоянной доработки? При создании агентных систем важно не только подключить LLM, но и правильно организовать логику работы агентов.
На открытом уроке 1 октября в 20:00 МСК разберем, как навыки агента (agent skills) помогают ускорить создание ИИ-агентов, стандартизировать их логику и повторно использовать готовые решения. Вы узнаете, какие ИИ-инструменты помогают разработчикам быстрее собирать агентные системы и как применять эти подходы на практике.
Урок пройдет в преддверие старта курса «Разработка ИИ-агентов». Занятие подойдет разработчикам, ИИ-инженерам и техническим специалистам, которые создают агентные решения и хотят повысить скорость и качество разработки.
Научитесь создавать более предсказуемые ИИ-агенты и тратить меньше времени на рутинную реализацию: https://otus.pw/mJsM/?erid=2W5zFJZtwNH
Реклама. ООО "ОТУС ОНЛАЙН-ОБРАЗОВАНИЕ". ИНН 9705100963.
jina-ocr-v1 - 3B модель для разбора документов на английском и китайском языках, рассчитанная под локальный запуск на недорогих системах.
Модель принимает скан, фотографию или PDF и на выходе выдаёт Markdown с поддержкой LaTeX.
Кроме полной транскрипции она распознаёт отдельные таблицы и формулы, подписывает изображения, отвечает на вопросы по документу и извлекает ключевые поля.
🟡Архитектура
DeepSeek-OCR с визуальным энкодером DeepEncoder на 380 млн параметров, который сжимает страницу до 256 визуальных токенов и при необходимости добавляет до девяти фрагментов по 100 токенов. Декодер - смесь экспертов на 3 млрд общих и 570 млн активных параметров.
Вклад Jina - спекулятивное декодирование FastMTP, где один общий блок предлагает три токена вперёд, а декодер принимает самую длинную часть, совпадающую с его собственным выбором.
🟡Тесты
На olmOCR-Bench модель набрала 83,4 балла - на 7,4 больше DeepSeek-OCR и выше olmOCR-2 с 8B параметров (82,4), но ниже chandra-ocr-2 (85,8) и dots.mocr (83,9).
На OmniDocBench v1.6 результат 91,14 против 90,25 у DeepSeek-OCR-2, но хуже более компактных PaddleOCR-VL-1.6 (96,34) и HunyuanOCR-1.5 (94,74).
По пропускной способности модель первая среди 14 систем - 2,57 страницы в секунду на одной A100 при 32 параллельных запросах.
На L4 FastMTP ускоряет генерацию в 1,95 раза в обычном режиме, но с CUDA-графами прирост падает до 1,17 раза.
⚠️ FastMTP работает только в vLLM 0.21 и новее
Без установки модель доступна через Jina Reader и онлайн-песочницу по ключу API Jina.
🚨 Alibaba представила один из самых агрессивных планов развития ИИ
Главное:
• Qwen 4 уже обучается
• Qwen 4.5 и Qwen 5 планируют масштабировать до 5–10 трлн параметров
• Qwen исследует рекурсивное самоулучшение: модели находят слабости, проектируют эксперименты и создают данные для следующего обучения
• M890 уже запускает модели крупнее 2 трлн параметров
• кластеры на новых V900 смогут объединять до 500 000 ускорителей
• мощность глобальных дата-центров Alibaba Cloud должна превысить 20 ГВт к 2032 году
Запуск массового производства V900 перенесли с III квартала на I квартал 2027 года. По словам главы Alibaba Эдди Ву, в будущем объём машинного «мышления» может превысить человеческий в 1000 раз.
25 сентября у тебя будет шанс познакомиться сразу с четырьмя технологическими командами, которые строят GigaChat изнутри: от данных и поиска до платформы AI-агентов и backend-сервисов массового продукта.
Ты сможешь заглянуть в текущие проекты Сбера, понетворкать, а еще — обменяться контактами с лидерами ключевых backend-команд GigaChat
Регистрируйся по ссылке — встречаемся 25 сентября в 19:00 по адресу: Москва, «Оригинал», Земляной Вал, 9А!
Xiaomi закончила обучение серии MiMo-V2.6 и опубликовала веса флагманской Pro и облегчённой Flash.
Обе модели омнимодальные, то есть принимают текст, изображения, видео и аудио.
Рассчитаны на агентные задачи, кодинг, автоматизацию рабочих процессов, управление компьютером, кибербезопасность, генерацию 3D-объектов, воплощенное моделирование, создание музыки, научные и математические исследования.
🟡Архитектура
У Pro 1,02 трлн параметров, из них 42 млрд активных, и 384 эксперта.
У Flash 309 млрд параметров, 15 млрд активных и 256 экспертов.
На каждый токен в обеих моделях работают восемь экспертов. Большая часть слоёв использует внимание со скользящим окном в 128 токенов, остальные – глобальное внимание: у Pro так устроены 60 слоёв из 70, у Flash 39 из 48.
Визуальный энкодер на 681 млн параметров и два аудиоэнкодера на 308 и 127 млн у моделей одинаковые.
Вывод ускоряет пятислойный спекулятивный декодер - за один проход он предлагает семь следующих токенов, основная модель проверяет их параллельно.
Контекст – 1 млн токенов
🟡Бенчмарки
По замерам самой Xiaomi Pro близка к закрытым флагманам в агентных тестах, но отстаёт в эксплуатации уязвимостей:
DeepSWE v1.1: Pro – 71,9, Flash – 67,9, Claude Opus 5 – 74,0, GPT-5.6 Sol – 73,0;
AutomationBench: Pro – 53,1, выше Opus 5 (50,3) и GPT-5.6 Sol (45,8);
Terminal-Bench 4.0: Pro – 34,9 против 49,0 у Opus 5 и 42,4 у Claude Fable 5;
ExploitBench: Pro – 47,9, Flash – 25,3 против 78,5 у GPT-5.6 Sol и 78,0 у Fable 5.
Модели также доступны в AI Studio, MiMo Code, приложении MiMo Desktop, через API Xiaomi MiMo Open Platform и на OpenRouter.