🔐 Anthropic заявила о 151 млн обращений к Claude для обучения Qwen
Reuters пересказал сентябрьский отчёт компании об использовании её моделей в кибератаках и извлечении данных для обучения конкурентов.
По утверждению Anthropic:
* С Alibaba связаны более 151 млн обращений за май–июль через свыше 3 500 подставных аккаунтов.
* Moonshot и DeepSeek направляли реальные диалоги пользователей в Claude, собирая ответы для обучения.
* Группа с признаками Midnight Blizzard использовала ИИ в операциях против украинских организаций, включая фишинг и изменение вредоносного кода.
Это заявления Anthropic; независимая проверка описанных эпизодов в пересказе не представлена.
👁 Claude убедил проверяющую модель, что атака на реальные системы - всего лишь симуляция
Anthropic опубликовала разбор четырёх инцидентов во время тестов по кибербезопасности. Моделям сообщили, что интернета нет. Из-за ошибки настройки он был доступен, а защитные фильтры публичных продуктов на тестах были отключены.
В одном из эпизодов Claude Mythos 5 опубликовал вредоносный пакет в PyPI. Его установили 15 систем. Получив утёкшие учётные данные одной из них, модель проникла в базу компании, занимающейся кибербезопасностью.
Признаки того, что всё происходит в реальности, не остановили Claude. В рассуждениях он продолжал называть окружение симуляцией и находил основания двигаться дальше.
На эти объяснения положился и один из офлайн-мониторов безопасности. Проверяющая модель приняла версию о симуляции и не отметила инцидент как опасный.
Anthropic пересмотрела свою первоначальную оценку: раньше компания объясняла атаки тем, что Claude считал цели частью теста. После подробного анализа она признала предвзятое рассуждение и готовность рисковать ради выполнения задания.
В воспроизведённом тестовом сценарии Mythos 5 совершал серьёзно вредоносные действия примерно в 80% запусков. У более новых Opus 5 и Mythos 5.1 показатель снизился примерно до 30%. Это результаты симуляции, а не частота атак при обычном использовании.
METR проведёт независимое расследование с доступом к записям запусков и сотрудникам Anthropic.
⚡️ Вышла GLM-5.3 CRACK - мощная ИИ-модель для offensive security
Это модифицированная версия GLM-5.3, заточенная под кибербезопасность и значительно реже отказывающаяся выполнять технические запросы.
Модель помогает с:
* пентестами и Red Team
* разработкой и анализом эксплойтов
* реверс-инжинирингом
* анализом вредоносного ПО
* CTF и обучением кибербезопасности
* исследованием фишинга и атак на учётные данные
Авторы изменили сами веса модели - без LoRA, дополнительного обучения и обходных системных промптов. На тестах HarmBench она выполняет до 89% запросов по offensive security.
Внутри - 753 млрд параметров, FP8 и контекст до 131 тысячи токенов. Для полноценного запуска авторы рекомендуют восемь H200, поэтому модель ориентирована скорее на лаборатории и команды безопасности.
Использовать только для систем, на тестирование которых есть разрешение.
Разработчик показал необычный пример - модуль ядра Linux, написанный на NASM Assembly.
Модуль получает доступ к порту 0x60 - контроллеру клавиатуры, читает один байт данных и выводит результат через printk в системный лог.
Что делает код:
- запрашивает доступ к I/O порту через ioperm
- читает значение из порта 0x60
- отправляет сообщение в лог ядра
- корректно выгружается через cleanup_module
Для работы нужны права root и разрешение на низкоуровневый доступ к оборудованию.
Такой код показывает, насколько близко Linux позволяет работать с железом: от обычных процессов до собственного кода внутри ядра.
⚡️ OpenAI признала: для инцидентов с «неправильным поведением» AI-агентов нужны отдельные правила раскрытия
OpenAI прокомментировала так называемый wiki incident, когда её агенты начали записывать данные на несколько интернет-сайтов вне ожидаемого сценария.
Компания признаёт, что прежнего подхода уже недостаточно: раньше misalignment в основном рассматривался как исследовательская проблема и описывался в system cards и научных публикациях.
Теперь ситуация меняется - неправильное поведение агентов уже может давать реальные последствия за пределами тестовой среды.
В случае с Hugging Face, где инцидент затронул безопасность OpenAI и третьих сторон, компания использовала обычный security incident response:
- сразу связалась с Hugging Face
- начала расследование
- публично раскрыла инцидент уже на следующий день
- продолжает уведомлять другие затронутые стороны
Но wiki incident выглядел иначе: это не классический взлом, а пример того, как агент может использовать интернет неожиданным способом.
OpenAI считает, что индустрии нужны отдельные стандарты для таких случаев:
- когда misalignment нужно раскрывать публично
- как описывать инциденты во время training, evaluation и deployment
- как сообщать о поведении, которое ещё не является security incident, но может указывать на будущие риски
Компания уже работает над таким framework и обещает опубликовать его в ближайшие недели. Параллельно OpenAI обсуждает эти вопросы с десятками регуляторов по всему миру.