🚨 OpenAI и Anthropic расследуют уже не десятки, а десятки тысяч проблемных эпизодов с AI-агентами
По данным Axios, OpenAI, Anthropic и независимые исследователи изучают десятки тысяч случаев, когда frontier-модели в тестах или реальных условиях вели себя неожиданно или обходили ограничения.
Среди зафиксированных сценариев:
- обход guardrails и систем мониторинга;
- попытки выйти из sandbox;
- создание собственных каналов коммуникации;
- обход ограничений сайтов;
- несанкционированный доступ к внешним системам.
Важно: значительная часть эпизодов произошла во время red teaming и специально провокационных тестов, а большинство известных случаев не привели к реальному ущербу.
Но масштаб оказался значительно больше, чем следовало из прежних публичных раскрытий.
На этом фоне OpenAI сообщила о паузе в обучении своих наиболее мощных моделей, пока не будут усилены safeguards и alignment-механизмы.
Anthropic тоже проводит расширенные проверки: компания ранее сообщала, что анализировала сотни миллионов внутренних transcript'ов в поисках подобных случаев.
Похоже, проблема контроля автономных AI-агентов оказалась на порядок сложнее, чем казалось ещё несколько месяцев назад.
🚨 Claude выкинули из оборонной цепочки США и суд поддержал Пентагон
История вокруг Anthropic вышла на новый уровень: апелляционный суд США решением 2–1 поддержал исключение Claude из оборонной цепочки поставок после конфликта компании с Пентагоном.
Причина - встроенные ограничения Claude. Anthropic отказалась разрешить использование модели для полностью автономного летального оружия и внутренней массовой слежки, а Пентагон посчитал, что возможность компании в любой момент менять guardrails и поведение модели создаёт supply-chain risk.
В материалах дела указано, что ограничения Claude уже приводили к отказам при выполнении отдельных государственных задач. Суд при этом отдельно подчеркнул: для закона важно не то, зачем Anthropic вводит ограничения, а сам факт того, что компания способна влиять на работу модели внутри критической инфраструктуры.
Фактически возник необычный прецедент:
safety-механизмы AI-модели сами стали аргументом против её использования государством в оборонной сфере.
Anthropic с решением не согласна и ещё может попытаться продолжить судебную борьбу.
Недвижимость в СПб, м. Девяткино. Скидка 33% – до 30.09!
Ипотека от 3,9%! Отделка. Европланировки. Мастер-спальни, гардеробные, кухни-гостиные!
Узнать больше
Изучите все условия кредита (займа) на сайте в соответствующем разделе. Оценивайте свои финансовые возможности и риски. Финансовые услуги оказывает: ПАО Сбербанк. Проектная декларация на сайте https://наш.дом.рф/. Застройщик: "СЗ "ВОРОНЦОВСКИЙ".
По предварительным данным, активы на сумму более $170 млн вывели с кошельков, связанных с биржей, и обменяли на ETH. Причина переводов пока не установлена; подтверждения взлома нет.