🗑 ИИ удалил 700 ГБ файлов во время теста защиты от удаления файлов
Разработчик попросил Claude Fable написать скрипт для безопасной очистки /tmp и проверить его на опасные сценарии. Но система безопасности Anthropic сочла задачу рискованной и переключила модель сначала на Opus 5, а затем на Opus 4.8. Это и привело к катастрофе.
В итоге ИИ запустил проверку и снёс примерно 700 ГБ данных из домашнего каталога
🖥Если ты хочешь обучиться вайбкодингу и при этом иметь возможность провести аудит безопасности своего продукта, то тебе сюда:
Lab IT - репозитории, полезные инструменты, курсы и многое другое по Айти:
ЭЙ, АЙ! - бесплатные инструменты, репозитории, обучающие материалы для упрощения работы с ИИ.
CyberGuard - оплот для ИБ-специалистов со всего телеграма. Тут ты точно узнаешь, как не оплошаться с запуском своего продукта, и защитить его от злоумышленников
💻 Айтишника развели на 200 тысяч под предлогом оффера
Мошенники действовали по простой и давно обкатанной схеме. Соискателям просто кидают тестовое, в котором надо найти баги, а доверчивые и отчаявшиеся от рынка труда работяги без страха скачивают репозиторий, запускают код, а с ним вместе и вирус, который уводит данные счетов и криптокошельков.
Человек между агентом и кнопкой: почему слой подтверждения — это такая сложная инженерия
Мой агент дошёл до состояния, когда я перестал читать письма перед отправкой. Между «агент решил» и «письмо ушло» не было ничего — ни паузы, ни человека, ни записи о произошедшем.
Слой подтверждений выглядит как день работы: таблица, кнопка «одобрить», кнопка «отклонить». Я вёл каталог отказов, пока его делал. К релизу в нём было 66 пунктов. Разбираю пять, которые почти всегда переживают первую версию, и показываю, почему 100% покрытия по ветвям ничего не гарантируют.
Все пять safety-свойств Raft прошли. Две реплики разошлись
Реализация Raft на TypeScript под сидированной симуляцией: каждый тик, каждая задержка сообщения и каждое падение узла берутся из сида. На двадцать пятом прогоне две реплики применили разные значения — при том, что правила алгоритма выполнялись все до одного.
Интересен не сам баг, а то, какая проверка его поймала. И вопрос, который из этого следует: откуда я знаю, что остальные проверки вообще на что-то смотрят.