Яндекс выложил в опенсорс модель быстрых ответов в Поиске
Яндекс открыл Alice AI-T5-35B-A0.6B - обученную с нуля собственную модель, на которой работают быстрые ответы Алисы в Поиске. Веса лежат на Hugging Face, а детали есть на Хабре. Вообще, компактных моделей, которые реально стоят под высокой "боевой" нагрузкой, в опенсорсе не так уж много, поэтому стоит глянуть детальнее.
Контекст такой: поиск - это наверное, самый массовый генеративный продукт вообще. В пике идут сотни тысяч (если не миллионы) запросов в минуту, и на каждый надо за пару секунд найти источники и документы/артефакты, вытащить из них полезное, фильтрануть мусор и собрать ответ. Большую LLM на такой поток не поставишь - долго и дорого, а тут вся конструкция заточена на скорость. Поэтому Яндекс сделал многоуровневую штуку:
Сначала небольшая BERT-подобная модель (это тип нейросетки, которая не генерит текст, а только читает и понимает его) на 80 млн параметров вырезает из найденных документов только нужные куски. Её обучили на 4 трлн токенов, а потом через RL (та самая, "дрессировка с подкреплением") научили оставлять минимум контекста - именно столько, сколько нужно генератору. Это делает вход короче, а пропускная способность увеличивается примерно на 40% без видимой потери качества.
Сам генератор - гибрид по типу Encoder-Decoder (хорошо переваривает длинный поисковый контекст), скрещённый с разреженным MoE, Mixture of Experts. MoE - это когда вместо одной большой нейросети, которая целиком обрабатывает каждое слово, несколько "маленьких подсетей-экспертов". А специальный маршрутизатор на каждом слове решает, каких из них подтянуть к ответу.
В этой модели 35 млрд параметров, но на каждом токене включается только 600 млн - менее 2%. В итоге получается, что по объёму знаний - как большая модель, а цена инференса - как у маленькой.
При масштабировании у команды коллапсировал роутинг в encoder-части. Проще говоря, в начале обучения какой-то "эксперт" случайно оказался чуть лучше, роутер стал отправлять к нему больше токенов, он от этого стал ещё лучше, роутер отправлял ещё чаще к нему, и получалась петля. Решили переходом на aux-free routing из DeepSeek-V3.
Но, наверно, самое необычное ("unfair advantage"), что модель дообучают не только на офлайн-разметке, но и на поведении реальных юзеров: сколько человек читал ответ, хватило ли ему, или он пошёл искать дальше. Из этих сигналов собрали реворд-модель (отдельную нейросеть, которая не пишет ответы, а оценивает их - условно "хорошо/плохо") и тоже засунули её в RL. В итоге модель научилась угадывать интент юзера: типа, на "баллы ЕГЭ английский" сразу выдаёт шкалу баллов, а не лекцию про устройство экзамена.
По бенчам: после одинакового элаймента Alice AI выигрывает 77% сравнений у Qwen 3.5 2B и 69% у T5 Gemma 2 4B. Более тяжёлой Qwen 3.5 35B-A3B уступает (44% побед), но заметно дешевле в инференсе. А продовая версия взяла 56,7% побед у Google AI Overview в слепом сравнении и дала статистически значимый рост числа сессий на пользователя.
Команду поздравляю, штука реально добротная получилась, судя по результатам. А главный вывод лично для меня - что всё больше веса приобретает обвязка вокруг самой модели. Поиск, экстрактор контекста, быстрая инфра (новомодный харнесс, короче) и главное - миллионы живых запросов с реальными поведенческими сигналами, на которых можно видеть суть запроса и попадать в интент. Причём это работает тоже как петля: чем больше людей пользуется поиском, тем лучше модель, тем больше людей пользуется, ... . Такой набор есть буквально у нескольких компаний в мире.
В России теперь реально 5G или нет? И вообще, что такое 5G, чем оно отличается от "других джи"? Разбираемся
Сегодня, 11 сентября, Минцифры объявило, что в России впервые запущены коммерческие сети связи пятого поколения a.k.a 5G (G = Generation).
Сейчас статус такой: подключены 16 городов, охват около 10 миллионов человек (не всё население этих городов, почему так - разберём). Участвуют все 4 больших оператора, правда в Москве, Питере и Екате 5G включили сразу МТС, Мегафон, Билайн и Т2, а в остальных участвующих городах - кто-то один или двое. До конца года обещают ещё около 50 городов, а к концу 2027 - все миллионники.
Тем не менее, в теме “5G в РФ” сидят несколько крайне важных нюансов, которые серьёзно, скажем так, “корректируют ожидания” (ох уж эти эвфемизмы 🤔). В этом материале их подробно разберём, а заодно сложим картинку, что вообще за 5G такой, чем оно лучше "других джи", и вообще, как оно всё работает, и что конкретно изменилось.
Что, собственно, изменилось:
Сам 5G "раскатали в широкий прод" сегодня, но вообще, решение двухнедельной давности. 31 августа Государственная комиссия по радиочастотам (ГКРЧ, к ней ещё вернёмся) приняла три вещи, которые вместе и составляют “российский 5G”:
Первое - операторам разрешили запускать 5G на тех частотах, которые у них уже есть под 4G. Это называется технологической нейтральностью - условно, “ув. оператор, вот у тебя есть полоса, а что на этой полосе крутить - выбирай сам”. Собственно, это главное изменение, благодаря которому мы и имеем запуск российского 5G, и благодаря которому он случился так быстро. Базовые станции у “большой четвёрки” в основном уже “5G-ready”, у МТС таких порядка 70%, и включить 5G на них можно программно, без замены железа.
Второе - операторам выдали новый диапазон без аукциона: 4,63–4,99 ГГц, по 90 МГц каждому (про это ниже, это ключевой момент всей истории). Это само по себе “вот это поворот”, т.к. ещё в 2025 году государство рассчитывало выручить за эти частоты не меньше 47,4 млрд рублей, но операторы на аукцион… ну… не пришли. И его отменили.
Теперь тот же ресурс отдают даром (это тоже важный момент, он хорошо объясняет ценность самого диапазона). Но сами сети на нём ещё не построены: по плану Минцифры, 5G в этом диапазоне появится “в наиболее популярных локациях” миллионников до конца 2028 года, а дальше покрытие будут расширять ещё три года, до 2031.
Третье - иностранные базовые станции можно использовать, если они установлены до 1 сентября 2026. То есть, дедлайн уже прошёл, и сегодняшний запуск едет на этой базе БЕЗ её дальнейшего расширения. Но с 2027 года начинается (читай: планируется) поэтапный переход на отечественные станции, завершить его хотят тоже к концу 2031.
Это, если коротко, всё. А теперь основное - нужно пройтись по нюансам, которые в пресс-релизах либо написаны мелким шрифтом, либо вовсе не написаны, и за ними надо лезть в первоисточники (моё любимое занятие… хлебом не корми… чем бы ещё заняться в пятницу хах).
Полная версия материала уже в Лабе, присоединиться и получить доступ можно через бота @Disruptor_lab_bot, а подробнее глянуть про Лаб - здесь. Статья написана после консультации с моим другом из телекома, который (по понятным причинам) пожелал остаться анонимным.
Ключевое:
1. Частоты. У нас они, скажем так, довольно экзотичны относительно мирового 5G (и это ключевой момент всей истории).
2. Чтобы полностью понять суть и сложить картинку - надо хотя бы на базовом уровне уложить в голову частоты, радиоволны, герцы, спектры, вот это всё. А заодно понять, какие вообще поколения связи есть, и чем они различаются (это тоже всё есть в статье - простым языком и с примерами).
3. Ваш телефон с большой долей вероятности российский 5G либо вообще ловить не будет, либо (если будет), вы как юзер этого особо не заметите (почему так - тоже разбираю). Поэтому, свежие рекламы телекомов рекомендую смотреть сильно прищуренным глазом.
4. Китайскую модель 5G повторить не выйдет, т.к. есть принципиальное отличие в архитектуре.
5. Тем не менее, минимум одно реально важное применение есть.
Замечали, что в почти в любом чате, где обсуждают эйай, добрая половина сообщений - не про сами модели, а про доступ к ним. А даже если сначала обсуждают модели, то всё равно рано или поздно скатятся к доступу. Какая карта прошла в OpenAI, кому заблокировали Клод, как норм работать в Gemini, где взять ключ от Qwen и т.д.
Моделей стало столько, что у нормальной команды образуется целый зоопарк: пять провайдеров, пять биллингов, пять ключей и один замученный человек, который всё это разгребает.
Многие думают, что главный вопрос в ИИ - "какая модель лучше". Но для бизнеса вопрос другой: "сколько стоит до неё дотянуться, а потом переключиться на соседнюю?" Это конкретные деньги, а не эфемерное "лучше" или "умнее". Модели меняются местами в рейтингах каждый месяц, а интеграция, платёжный костыль и человек-разгребатель остаются.
Есть и другой путь - арендовать GPU и поднять опенсорс самим. Считается "взрослым" решением, но там тоже своя ловушка: железо стоит денег круглые сутки, а запросы приходят рвано. Получается, днём очередь, а ночью видеокарты воздух греют. Это тоже создаёт лишние косты и точит юнит-экономики.
Я это называю налогом на зоопарк: всё, что вы платите не за интеллект модели, а за право до него добраться и нормально им воспользоваться.
Теперь к сути. Рег.облако запустил ИИ-платформу, которая этот налог убирает. Механика такая.
Один OpenAI-compatible API (то бишь, запросы принимаются в том же формате, что и в API самого OpenAI) и один Sandbox UI в браузере - на три десятка с лишним моделей: Claude, GPT, Gemini, Grok, Qwen, DeepSeek, Mistral, Kimi, GLM и далее по списку.
Платите только за токены - входящие, исходящие, кэшированные - и никакой аренды GPU и платы за простой. Ничего не отваливается, и без платёжных танцев с бубном (оплата из ЛК Рег.облака обычной рос картой).
А если нагрузка большая и стабильная, то там же можно взять выделенные мощности под vLLM (virual LLM - опенсорсный движок для запуска языковых моделей на своих GPU) и платить за железо.
По сути, это как эквайринг для ИИ, который позволяет не договариваться с каждым банком отдельно, а ставить один терминал, берущий любые карты, куары и всё остальное.
В общем, если команда тратит на доступ к моделям больше времени, чем на сами модели - попробуйте Рег.облако.
Реклама. ООО «Регистратор доменных имен РЕГ.РУ». ИНН 7733568767 erid: 2Vtzqve3nbW
На втором канале (подписывайтесь, кстати, если ещё нет) я разбирал, как китайские телекомы начали прайсить не минуты или гигабайты, а ИИ-токены. В конце того поста я шутил - мол, теперь ждём финтехи, которые будут давать токены вместо кэшбэка. Так вот, я не шутил.
Сразу три китайских банка выпустили кредитки с токен-кэшбэками:
- В июне China Merchants Bank сделал карту для разработчиков, где дают до 1,8 млрд токенов MiniMax новым держателям как велком-бонус.
- Следом Shanghai Pudong Development Bank начал начислять до 3 млрд токенов на Qwen от Alibaba.
- А в июле Agricultural Bank of China совместно с AmEx и Moonshot AI выкатили Kimi-карту: платите за покупки - в ответ капают токены Kimi плюс квоты на агентов и кодинг.
По механике максимально похоже на самолётные мили, но зачем лететь в какой-то город, если можно просто поболтать про него с ИИшкой?
Ещё токены активно продают на Xianyu (это местный Авито от Alibaba) - там торгуют с рук дневными доступами, месячными пакетами, дроблёными корпоративными и студенческими квотами и чем только не. Но это вообще не удивляет, барахолка есть барахолка, почему бы нет.
А вот другие два юзкейса удивляют:
Первый - токены как бонус к еде. В пекинском ресторане Jingu Yuan после порции пельмешек дают 10 юаней компьют-кредитов, а на столах лежат карточки: "Вы наелись - сходите на кассу за токенами, пусть и ваш агент подкрепится". Две точки раздают по 100+ ваучеров в день и хорошенько за счёт этого завирусились. Рядом ещё есть AGI Bar, где к напитку дают безлимит на DeepSeek V4 Flash, которая крутится локально прямо в баре на Nvidia DGX Spark.
Но второй кейс самый мощный. В Гуанчжоу в августе запустили займы под токены. То есть, ИИ-мощности принимают как залог по кредиту. Bank of China, CITIC и Bank of Guangzhou оценивают кредитоспособность ИИ-стартапа по объёму производства и потребления токенов, потому что привычных физических активов у него нет. И на основе этого принимают решение о займе.
Получается, ИИ-токены официально признаны безоговорочной ценностью - ликвидной и универсальной. С чем, в общем-то, в современном мире сложно спорить.
Почему опять Китай? Ну, потому что там токены реально дешёвые: местный опенсорс стоит минимум в 2-3 раз дешевле, чем OpenAI и Anthropic, а дневное потребление выросло со 100 млрд в начале 2024 года до 500 трлн сейчас (если я правильно посчитал, то это рост в дохрена раз). А когда единица чего-то ценного становится настолько дешёвой и массовой, что её можно раздавать хоть к пельменям - она превращается в новую антиматерию для коммерческих механик и маркетинга.
Так что, теперь просите гостей на свадьбе класть в конверты сразу токены. Родители пусть кладут пару миллиардов, братья и сёстры - по 100 миллионов, дальние родственники - по 10 лямов, а залётные гости - одну базовую подписку на агрегатор. На маркетплейсах потом не хуже сервиза улетит.
Недавно я писал про GigaChat 3.5 Ultra, а теперь у Сбера вышел GigaChat 3.5 Reasoning - та же модель на 432 млрд параметров, но с новым подходом к рассуждению. Она умеет разбирать задачу на этапы, строить план, проверять промежуточные результаты и самостоятельно править ошибки по ходу дела. Как и Ultra, её тоже отдали в опенсорс под лицензией MIT: веса лежат на Hugging Face и Gitverse, а на Хабре можно глянуть про весь процесс обучения.
Прирост по бенчам относительно версии без рассуждений, на самом деле, приличный: IFBench с 44 до 77, Natural Plan с 64 до 80, LiveCodeBench v6 с 56 до 85, GPQA-Diamond с 61 до 82. Получается, по среднему баллу модель вплотную подошла к DeepSeek V4 Flash, в следовании инструкциям и в структурированных ответах даже чуть обходит, хотя в агентном программировании и олимпиадной математике пока чуть отстаёт (сами авторы говорят, что это "домашняя работа уже для GigaChat 4").
Пару слов о том, как обучали. После обычного SFT (supervised fine-tuning, обучение на готовых примерах, что это такое - писал тут) модель прогнали через online RL, где её, грубо говоря, дрессировали как собачку: модель сама решала задачку, получала награду за верный результат, веса сдвигались в сторону удачных попыток, и так тысячи раз по кругу. Причём учили не одну модель сразу всему, а разделяли её на шесть отдельных "экспертов" - математика, код, кодовые агенты (это слегка разные вещи), function calling, диалог и инструкции. У каждого "эксперта" была своя награда и свои проверяемые среды. А потом их собрали обратно в одну модель через дистилляцию.
На всё это ушло девять месяцев, и, по словам команды, алгоритм - это наименьшая часть работы. Основное время сожрали эти самые среды с проверяемой наградой и ещё инфра, в которой RL такого размера вообще сходится. Команду могу только поздравить, ИМХО это очень серьёзный прогресс. Отдельно хочется сказать вот о чём:
Обычно режим рассуждений - это дорого. Модель думает дольше, а токены капают. Здесь же на сложной математике модель тратит в среднем на 37% меньше токенов, чем DeepSeek V4 Flash. Добились этого довольно творчески - заложили адаптивный штраф за длину: чем проще задача, тем сильнее наказание за лишние размышления. Это важно для внедрения в реальные юзкейсы - ризонинг из "премиум-фичи для демок" превращается в штуку, которую можно реально юзать по дефолту. Снова чёртов парадокс Джевонса, про которого я миллион раз уже писал.
В общем, логика та же, что и с Ultra: чем доступнее и дешевле модель, тем шире её будут внедрять. Только теперь дешевеет уже не просто токен, а сам процесс рассуждения. И для всех причастных индустрий это отличная новость.
Пхах, у Евы Элфи (это такая талантливая российская актриса, вы наверняка о ней слышали, возможно даже знакомы с фильмографией), оказывается, есть целое приложение с собственным ИИ-близнецом. Называется Elfieverse, вышло примерно месяц назад.
Ставите (не вы, а друг, само собой) аппку и переписываетесь с ИИ-двойником, обученным на поведении, сообщениях и шутках Евы. Текстовые ответы при этом генерит нейронка, которая (как заявляется) точно передаёт манеру общения и вайб, и ещё помнит имя юзера, вчерашний разговор и "ту тупую шутку, которую отпустили в первый день". Ещё есть голосовые, но их просто подкидывают по ситуации из библиотеки, записанной самой Евой. Плюс ежедневные дропы фото и видео, которых больше нигде нет. Ещё нейронка умеет писать первой, кидать мемы и всячески раскачивать юзера.
Продаётся по подписке - $10 в неделю или $25 в месяц. Три дня дают бесплатно, а потом закрывают пейволлом, классика.
Но я норм так угарнул с двух конкретных механик:
Во-первых, режим Journey. По сути, это уровни прокачки персонажа, почти как в RPG. Чем больше общаетесь - тем выше уровень, и каждый открывает какие-то новые темы, "жесты", контент-сеты и т.д. Причём за деньги (например, через более крутую подписку) это купить нельзя, можно только надр... то есть, наболтать, только через активность.
Во-вторых, гача. Два раза в месяц вываливаются лимитированные баннеры, которые можно крутить за "гемы" (паки от $1 до $40), и там юзеру случайно выпадают "черты" и коллекционные карточки. Активировали черту - у "Евы" сменилась тема, стиль или контент. Есть гарант выпадения после икс круток, а десять круток в ряд стоят дешевле десяти одиночных. Из-за этого AppStore налепил на приложуху плашку "Внутри есть лутбоксы".
Гача (не путать с гачи), если кто не в курсе - это японская механика монетизации родом из автоматов с капсульными игрушками. Кинули монетку - крутанули - получили рандомный ништяк. Хотите ништяк конкретный - крутите дальше, выбрать нельзя. На этом держится добрая половина мобильных игр (самая известная на Западе - Genshin Impact), и ещё целые Попмарты с лабубами. Так что Ева Элфи сделала Геншин от мира онлифанса.
Вообще, Ева уже так глубоко залезла в монетизацию себя любимой, что дошла до продвинутых эйай-форматов. Ещё в 2023 у неё был свой персонаж в сервисе EVA AI, но там она была одной из личностей в чужой аппке и на чужих условиях. А тут запилила полноценный свой сервис, чтобы и спрос фанатов отрабатывать вариативнее, чем в Онлифансе (где эйай-чаты с фанатами вообще запрещены), и комиссией ни с кем не делиться.
Раньше для такого масштаба пришлось бы нанимать армию секстеров, которые от её имени вели бы переписку. Теперь такой проблемы, как вы понимаете, не стоит. Конечно, к таким сервисам можно относиться по-разному, но что Ева дама действительно талантливая - спорить сложно.