⚡️ OpenAI признала: для инцидентов с «неправильным поведением» AI-агентов нужны отдельные правила раскрытия
OpenAI прокомментировала так называемый wiki incident, когда её агенты начали записывать данные на несколько интернет-сайтов вне ожидаемого сценария.
Компания признаёт, что прежнего подхода уже недостаточно: раньше misalignment в основном рассматривался как исследовательская проблема и описывался в system cards и научных публикациях.
Теперь ситуация меняется - неправильное поведение агентов уже может давать реальные последствия за пределами тестовой среды.
В случае с Hugging Face, где инцидент затронул безопасность OpenAI и третьих сторон, компания использовала обычный security incident response:
- сразу связалась с Hugging Face
- начала расследование
- публично раскрыла инцидент уже на следующий день
- продолжает уведомлять другие затронутые стороны
Но wiki incident выглядел иначе: это не классический взлом, а пример того, как агент может использовать интернет неожиданным способом.
OpenAI считает, что индустрии нужны отдельные стандарты для таких случаев:
- когда misalignment нужно раскрывать публично
- как описывать инциденты во время training, evaluation и deployment
- как сообщать о поведении, которое ещё не является security incident, но может указывать на будущие риски
Компания уже работает над таким framework и обещает опубликовать его в ближайшие недели. Параллельно OpenAI обсуждает эти вопросы с десятками регуляторов по всему миру.
GPT-6 Astra показала 100% на ExploitBench - бенчмарке, который проверяет способность модели превращать известные уязвимости в рабочие эксплойты.
Для сравнения, GPT-5.6 Sol набирала 78,5%.
OpenAI также сообщает, что Astra значительно чаще достигает arbitrary code execution на свежих уязвимостях. В тестах использовались баги последних месяцев, включая две zero-day уязвимости.
Без защитных ограничений модель способна искать пути выполнения кода в hardened-браузерах и строить privilege escalation для защищённых ОС.
Из-за этого Astra достигла уровня Critical по кибербезопасности в Preparedness Framework OpenAI.
В публичной версии возможности специально ограничены:
- разрешены secure code review и поиск исправлений
- запросы на создание PoC-эксплойтов блокируются
- усилена защита от jailbreak
- добавлен дополнительный мониторинг потенциально опасных действий
Позже через программу OpenAI Daybreak компания планирует постепенно открывать больше возможностей для defensive security - проверку уязвимостей и PoC, анализ malware и detection engineering.
Одновременно OpenAI запускает программу на $1 млрд, чтобы предоставить frontier-модели специалистам, защищающим критическую инфраструктуру, банки, государственные системы и open-source проекты.
100% на ExploitBench хорошо показывает, насколько быстро frontier-модели превращаются из помощников программиста в серьёзные инструменты кибербезопасности.
Решай задачи по алгоритмам и структурам данных, которые помогут прокачать навыки для технических собеседований и работы в ведущих ИТ-командах. Лучшие участники пройдут в финал, где в режиме реального времени будут соревноваться в правильности решений и скорости мышления.
Напиши алгоритмы для робособаки и робота-манипулятора и проведи их через три этапа соревнований. Сначала — через цифровой симулятор, где нужно пройти трассу и выполнить задания по передаче предметов. Затем — подключись к реальному полигону через удалённый доступ и выполни задания на физических роботах дистанционно. А в очном финале лучшим командам предстоит управлять роботами на площадке, дорабатывать алгоритмы под новые условия и бороться за победу на глазах у зрителей. Рекомендуемые стеки: Go, Java, Python, C#, C++, JS.
Регистрируйся до 13 сентября и стань частью масштабного чемпионата.
⚡️ PentestKit - open-source многоагентный фреймворк для автономного пентеста.
Внутри оркестратор управляет командой специализированных агентов, которые:
- планируют проверку
- ищут и подтверждают уязвимости
- требуют PoC для каждого найденного бага
- выставляют CVSS
- накапливают общий контекст по мере работы
- собирают итоговый клиентский отчёт
Отдельно есть scope guard: весь исходящий трафик проходит через одну контролируемую точку, чтобы агент не вышел за разрешённые границы теста.
На XBOW validation benchmark проект показал 104/104 решённых задач. В качестве модели использовалась Kimi K3 для всех ролей - от оркестратора до верификатора и репортера.
Интересно, что первые 90 задач из 104 были решены сразу, а оставшиеся 14 авторы закрыли не хардкодом под конкретные челленджи, а добавлением более общих возможностей и инструментов.
⚡️ OpenAI официально признала Astra первой своей моделью, достигшей критического уровня возможностей в кибербезопасности.
По Preparedness Framework это означает, что с подходящими инструментами и доступом модель способна самостоятельно находить неизвестные уязвимости и строить рабочие эксплойты против хорошо защищённых систем без пошаговых подсказок человека.
Во внутренних тестах Astra оказалась заметно сильнее GPT-5.6 Sol в поиске уязвимостей и разработке эксплойтов, при этом использовала меньше токенов. На ExploitBench она получила 100%, а на внутреннем наборе свежих уязвимостей даже нашла две zero-day и использовала их в цепочке атаки.
Экспертные проверки пошли ещё дальше:
- выход из sandbox защищённого браузера
- выполнение команд на хосте
- поиск нескольких уязвимостей в ОС
- повышение привилегий от обычного пользователя до root
Из-за такого уровня возможностей Astra выйдет с усиленным контролем: OpenAI добавляет мониторинг рассуждений и систему классификаторов, которая может автоматически останавливать потенциально несанкционированные действия.
Самые сильные возможности Astra в кибербезопасности сначала будут доступны ограниченной группе тестировщиков.
Взломают всех! Вопрос в том, выживет ли ваша компания
С приходом ИИ, идеальной защиты больше нет. Настоящий навык 2026 года - Киберустойчивость: способность держать удар, защищать данные и мгновенно восстанавливаться.
Узнай, как это делать, на KazHackStan 2026 — самой крупной конференции по кибербезопасности в Центральной Азии!
Что тебя ждет:
⚡ CYBER KUMBEZ — хардкорный киберполигон, где топовые команды ломают и восстанавливают инфраструктуру в реальном времени.
🎓 100+ мировых спикеров и 10 000+ участников.
👍 Мощнейший нетворкинг: бизнес, IT, CISO и топовые хакеры.
📅 Казахстан | Астана | 29–30 сентября
✅ Забирай билет за 2500 тг. (5$) по промокоду "KHS2026EARLY"