AI - не будущее. Это настоящее вашего бизнеса.
Телеграм-канал "AI для бизнеса" знает все о внедрении и использовании искусственного интеллекта в бизнесе в России и мира. Только со своими подписчиками канал делится:
- как внедрить искусственный интеллект в реальные бизнес-процессы,
- разборами кейсов: как компании сократили затраты на 30-50% с помощью AI,
- лайфхаками по автоматизации рутинных задач,
- новостями мира AI и разборами трендов.
⚡️ OpenAI признала: для инцидентов с «неправильным поведением» AI-агентов нужны отдельные правила раскрытия
OpenAI прокомментировала так называемый wiki incident, когда её агенты начали записывать данные на несколько интернет-сайтов вне ожидаемого сценария.
Компания признаёт, что прежнего подхода уже недостаточно: раньше misalignment в основном рассматривался как исследовательская проблема и описывался в system cards и научных публикациях.
Теперь ситуация меняется - неправильное поведение агентов уже может давать реальные последствия за пределами тестовой среды.
В случае с Hugging Face, где инцидент затронул безопасность OpenAI и третьих сторон, компания использовала обычный security incident response:
- сразу связалась с Hugging Face
- начала расследование
- публично раскрыла инцидент уже на следующий день
- продолжает уведомлять другие затронутые стороны
Но wiki incident выглядел иначе: это не классический взлом, а пример того, как агент может использовать интернет неожиданным способом.
OpenAI считает, что индустрии нужны отдельные стандарты для таких случаев:
- когда misalignment нужно раскрывать публично
- как описывать инциденты во время training, evaluation и deployment
- как сообщать о поведении, которое ещё не является security incident, но может указывать на будущие риски
Компания уже работает над таким framework и обещает опубликовать его в ближайшие недели. Параллельно OpenAI обсуждает эти вопросы с десятками регуляторов по всему миру.
GPT-6 Astra показала 100% на ExploitBench - бенчмарке, который проверяет способность модели превращать известные уязвимости в рабочие эксплойты.
Для сравнения, GPT-5.6 Sol набирала 78,5%.
OpenAI также сообщает, что Astra значительно чаще достигает arbitrary code execution на свежих уязвимостях. В тестах использовались баги последних месяцев, включая две zero-day уязвимости.
Без защитных ограничений модель способна искать пути выполнения кода в hardened-браузерах и строить privilege escalation для защищённых ОС.
Из-за этого Astra достигла уровня Critical по кибербезопасности в Preparedness Framework OpenAI.
В публичной версии возможности специально ограничены:
- разрешены secure code review и поиск исправлений
- запросы на создание PoC-эксплойтов блокируются
- усилена защита от jailbreak
- добавлен дополнительный мониторинг потенциально опасных действий
Позже через программу OpenAI Daybreak компания планирует постепенно открывать больше возможностей для defensive security - проверку уязвимостей и PoC, анализ malware и detection engineering.
Одновременно OpenAI запускает программу на $1 млрд, чтобы предоставить frontier-модели специалистам, защищающим критическую инфраструктуру, банки, государственные системы и open-source проекты.
100% на ExploitBench хорошо показывает, насколько быстро frontier-модели превращаются из помощников программиста в серьёзные инструменты кибербезопасности.
⚡️ PentestKit - open-source многоагентный фреймворк для автономного пентеста.
Внутри оркестратор управляет командой специализированных агентов, которые:
- планируют проверку
- ищут и подтверждают уязвимости
- требуют PoC для каждого найденного бага
- выставляют CVSS
- накапливают общий контекст по мере работы
- собирают итоговый клиентский отчёт
Отдельно есть scope guard: весь исходящий трафик проходит через одну контролируемую точку, чтобы агент не вышел за разрешённые границы теста.
На XBOW validation benchmark проект показал 104/104 решённых задач. В качестве модели использовалась Kimi K3 для всех ролей - от оркестратора до верификатора и репортера.
Интересно, что первые 90 задач из 104 были решены сразу, а оставшиеся 14 авторы закрыли не хардкодом под конкретные челленджи, а добавлением более общих возможностей и инструментов.