GPT-6 Astra показала 100% на ExploitBench - бенчмарке, который проверяет способность модели превращать известные уязвимости в рабочие эксплойты.
Для сравнения, GPT-5.6 Sol набирала 78,5%.
OpenAI также сообщает, что Astra значительно чаще достигает arbitrary code execution на свежих уязвимостях. В тестах использовались баги последних месяцев, включая две zero-day уязвимости.
Без защитных ограничений модель способна искать пути выполнения кода в hardened-браузерах и строить privilege escalation для защищённых ОС.
Из-за этого Astra достигла уровня Critical по кибербезопасности в Preparedness Framework OpenAI.
В публичной версии возможности специально ограничены:
- разрешены secure code review и поиск исправлений
- запросы на создание PoC-эксплойтов блокируются
- усилена защита от jailbreak
- добавлен дополнительный мониторинг потенциально опасных действий
Позже через программу OpenAI Daybreak компания планирует постепенно открывать больше возможностей для defensive security - проверку уязвимостей и PoC, анализ malware и detection engineering.
Одновременно OpenAI запускает программу на $1 млрд, чтобы предоставить frontier-модели специалистам, защищающим критическую инфраструктуру, банки, государственные системы и open-source проекты.
100% на ExploitBench хорошо показывает, насколько быстро frontier-модели превращаются из помощников программиста в серьёзные инструменты кибербезопасности.
Решай задачи по алгоритмам и структурам данных, которые помогут прокачать навыки для технических собеседований и работы в ведущих ИТ-командах. Лучшие участники пройдут в финал, где в режиме реального времени будут соревноваться в правильности решений и скорости мышления.
Напиши алгоритмы для робособаки и робота-манипулятора и проведи их через три этапа соревнований. Сначала — через цифровой симулятор, где нужно пройти трассу и выполнить задания по передаче предметов. Затем — подключись к реальному полигону через удалённый доступ и выполни задания на физических роботах дистанционно. А в очном финале лучшим командам предстоит управлять роботами на площадке, дорабатывать алгоритмы под новые условия и бороться за победу на глазах у зрителей. Рекомендуемые стеки: Go, Java, Python, C#, C++, JS.
Регистрируйся до 13 сентября и стань частью масштабного чемпионата.
⚡️ PentestKit - open-source многоагентный фреймворк для автономного пентеста.
Внутри оркестратор управляет командой специализированных агентов, которые:
- планируют проверку
- ищут и подтверждают уязвимости
- требуют PoC для каждого найденного бага
- выставляют CVSS
- накапливают общий контекст по мере работы
- собирают итоговый клиентский отчёт
Отдельно есть scope guard: весь исходящий трафик проходит через одну контролируемую точку, чтобы агент не вышел за разрешённые границы теста.
На XBOW validation benchmark проект показал 104/104 решённых задач. В качестве модели использовалась Kimi K3 для всех ролей - от оркестратора до верификатора и репортера.
Интересно, что первые 90 задач из 104 были решены сразу, а оставшиеся 14 авторы закрыли не хардкодом под конкретные челленджи, а добавлением более общих возможностей и инструментов.
⚡️ OpenAI официально признала Astra первой своей моделью, достигшей критического уровня возможностей в кибербезопасности.
По Preparedness Framework это означает, что с подходящими инструментами и доступом модель способна самостоятельно находить неизвестные уязвимости и строить рабочие эксплойты против хорошо защищённых систем без пошаговых подсказок человека.
Во внутренних тестах Astra оказалась заметно сильнее GPT-5.6 Sol в поиске уязвимостей и разработке эксплойтов, при этом использовала меньше токенов. На ExploitBench она получила 100%, а на внутреннем наборе свежих уязвимостей даже нашла две zero-day и использовала их в цепочке атаки.
Экспертные проверки пошли ещё дальше:
- выход из sandbox защищённого браузера
- выполнение команд на хосте
- поиск нескольких уязвимостей в ОС
- повышение привилегий от обычного пользователя до root
Из-за такого уровня возможностей Astra выйдет с усиленным контролем: OpenAI добавляет мониторинг рассуждений и систему классификаторов, которая может автоматически останавливать потенциально несанкционированные действия.
Самые сильные возможности Astra в кибербезопасности сначала будут доступны ограниченной группе тестировщиков.
Взломают всех! Вопрос в том, выживет ли ваша компания
С приходом ИИ, идеальной защиты больше нет. Настоящий навык 2026 года - Киберустойчивость: способность держать удар, защищать данные и мгновенно восстанавливаться.
Узнай, как это делать, на KazHackStan 2026 — самой крупной конференции по кибербезопасности в Центральной Азии!
Что тебя ждет:
⚡ CYBER KUMBEZ — хардкорный киберполигон, где топовые команды ломают и восстанавливают инфраструктуру в реальном времени.
🎓 100+ мировых спикеров и 10 000+ участников.
👍 Мощнейший нетворкинг: бизнес, IT, CISO и топовые хакеры.
📅 Казахстан | Астана | 29–30 сентября
✅ Забирай билет за 2500 тг. (5$) по промокоду "KHS2026EARLY"
AD-PathFinder - open-source инструмент для построения путей атак в корпоративной инфраструктуре через BloodHound CE.
Он расширяет граф не только Active Directory, но и данными из:
- ADCS
- SCCM
- MSSQL
- OpenGraph
Инструмент помогает видеть, как права, группы, сертификаты, серверы и другие сущности могут складываться в реальные attack paths.
Особенно полезно для red team, pentest и аудита AD, когда стандартного графа BloodHound уже недостаточно и нужно связать несколько источников инфраструктурных данных в одну модель.