12 августа Сбер выпустил своего первого универсального ИИ-агента. Про новость написал ТАСС. Было заявлено, что это «первый в России автономный универсальный ИИ-агент».
Автор — основатель компании, запустившей ИИ-агентов в феврале на своем ядре, — решил протестировать решение. 14 августа он начал тестирование: на счету cloud.ru лежало 293 рубля еще с прошлогоднего проекта. Он кликнул на подсказку «Расскажи, что ты умеешь». Прошло почти 5 минут, агент задумался. Автор устал ждать и отошёл от компьютера. В апреле он получил грант от Яндекса на миллион рублей на токены ИИ-моделей и с этого месяца поддерживает Alisa Ai LLM и Yandex GPT Pro, но это тема отдельного поста.
ОК или НеОК: как мы строили LLM‑судью и дважды меняли формулу вердикта
У AI‑агента поддержки было десять метрик и ноль ответов на главный вопрос: какую долю обращений он решает? Судья, который читал только текст диалога, ставил 18/20, а проверка по реальным вызовам инструментов давала 8/20. Текстовые проверки считали правдоподобный ответ верным и не могли отличить его от подтверждённого. Самодельный «процент фантомных эскалаций» оказался измерением того, насколько слова бота согласованы с его же внутренними флагами. Каждая метрика что‑то измеряла, и ничего продуктового.
Тогда мы решили: оценка качества станет отдельным сервисом с собственным источником истины. В статье два переписывания формулы вердикта, несколько пойманных слепот и один эталонный набор, который учил нас доверять неправильным ошибкам.
Генерация тест-кейсов — один из первых сценариев внедрения ИИ в тестирование. Отдаёшь модели требования или код — через несколько секунд получаешь готовый список проверок. Кажется, что рутину тест-дизайна можно закрыть промптом, а ручных тестировщиков — сократить.
Но тест-кейс — не синоним тестирования. Модель работает только с тем контекстом, что ей передали: не знает незафиксированные правила и может принять баг в коде за норму. Кейсов становится больше, а контроля качества — нет.
Разбираем, что ИИ реально снимает с QA, где создаёт лишь видимость покрытия и почему сгенерированный набор всё равно приходится проектировать и проверять человеку. Где прячется ложное покрытие →
Позер vs. Тру, или Как мы провели Endpoint Hack Zone
Валерий из экспертного центра безопасности Positive Technologies был модератором Endpoint Hack Zone. Он рассказывает, как команда Endpoint Security развернула MaxPatrol Endpoint Security и предложила хакерам выполнить ряд сценариев на защищённых хостах, чтобы доказать делом, что обещания — не просто реклама, а готовность пройти через стресс-тест настоящих хакеров.
😎 Нашли отличный курс, который позволит выжать максимум из агентов
Внутри учат, как правильно строить harness вокруг Codex и Claude Code: хранить состояние между сессиями, задавать агенту ограничения, не давать ему заканчивать задачу раньше времени и проверять, что получилось в итоге.
Всего в курсе 13 лекций с домашками, несколько практических проектов и готовые шаблоны, которые можно забрать себе.
Внутри собраны промпты для всех моделей: от Haiku 3 до Fable 5 и Opus 5. Можно посмотреть, какие инструкции модель получает ещё до начала диалога и как они менялись со временем.