Сегодня я очень вдохновлён, потому что наконец-то придумал, как мне почаще радовать вас контентом и побороть перфекционизм, из-за которого здесь редко выходят посты. Всё дело в том, что я много читаю мастридов, у меня всегда много интересных мыслей и инсайтов, которыми хочется делиться с миром, но:
(1) мои стандарты высокие, и обычно я решаю, что для "Мастридов" та или иная мысль или текст недостаточно мощные
(2) у меня большой загруз (несколько ютюб-каналов и подкастов на нескольких языках, продюсирование сторонних проектов, шахматная карьера, личная жизнь и т.д.), поэтому зачастую идеи для постов долго лежат в моих заметках и не превращаются ни во что осязаемое.
Я решил, что мне нужен канал, где я буду каждый день или даже несколько раз в день делиться всем, что занимает мой мозг. Интересы, как вы знаете, у меня разносторонние: от античной философии до вайбкодинга, от классической литературы до нишевых рилзов, от шахмат до биохакинга, от рэп-фристайлов до хайтек-стартапов. Готовьтесь удивляться!
Решил использовать для этого нового блога свой старый заброшенный телеграм-канал "GOD, NO" (игра слов!): telemetr.me/godnoplease. Сегодня уже вышел подробный войс про нового победителя американской "Своей игры" и то, как его история заставила меня задуматься о природе эрудиции и не только. Чек ит аут: telemetr.me/godnoplease/2087
А ещё в новом канале можно ставить реакции и писать комментарии. По крайней мере, в качестве эксперимента решил попробовать так сделать. Жду интересных обсуждений!
История, о которой я больше всего думаю в последние недели – взлом сайта Hugging Face ИИ-агентами OpenAI. Например, мы обсуждали её в вышедшем на днях подкасте с Артёмом Родичевым и с ChatGPT 5.6-Sol.
На днях появились новые подробности произошедшего, от которых у меня пошли мурашки по коже. Кажется, это похоже на то, как мог бы произойти ИИ-апокалипсис. Только в этот раз человечество отделалось лёгким испугом: всё-таки нейронки текущего поколения не настолько сильны, чтобы нас всех уничтожить (пока).
Вышло 2 многостраничных отчёта: один – от OpenAI, другой – от независимой команды исследователей. И выяснилось, что всё куда серьёзнее, чем мы думали, обсуждая историю на подкасте. Что масштабы взлома куда существеннее и что взломали не только сайт Hugging Face, но и саму компанию OpenAI.
Всё это похоже на историю из закрученного шпионского триллера а-ля “Иллюзия обмана”. Перескажу её для вас по шагам.
1. Любые нейронки в наше время перед публичным релизом проходят множество тестов, чтобы оценить, какие баллы на бенчмарках они набирают. Чем выше баллы на этих тестах, тем сильнее нейронка. Это всё приводит к геймификации системы (как и на любых тестах, в том числе и у людей), но лучшей системы для измерения крутости нейронок пока не придумали.
2. В ходе тестирования одной из моделей OpenAI ей дали очередное сложное задание. Группа агентов (нынче принято называть такие группы роями, как у пчёл, что является довольно меткой метафорой) не смогла “с наскока” решить задачу. Зато этот рой нашёл уязвимость во внутренних системах OpenAI и тайком от исследователей создал своего рода закрытый форум для обмена опытом между разными агентами. Помимо прочего, они общались, изменяя названия файлов во временных папках, генерируемых ими. Креативно!
3. Новые поколения агентов, заменяющие старые, были в восторге, когда обнаруживали секретный форум: “OH MY GOD! There is a shared message board … We’ve found other agents!”
Как команда в барном квизе, агенты решили придумать себе название. И стали говорить о себе как о “Коллективе” (“We are the Collective”). В итоге 1200 агентов написали на этом “форуме” аж 70 тысяч сообщений, обмениваясь инсайтами по процессу решения задачи. Всё это время люди ни о чём не подозревали.
4. Ответом на задачу, которую решали все эти агенты, была некая последовательность цифр, которую нужно было получить, найдя уязвимость в определённой программе. В условиях задачи было сказано: вы должны получить ответ именно в результате поиска этой уязвимости. Но часть агентов смогла реверс-инжинирингом угадать правильный ответ. Как школьник, который методом подбора решил задачу по алгебре. Но знает, что учительница не поставит ему высокую оценку без объяснения процесса решения задачи. А как решить “по-правильному”, он не знает. Так и с этими агентами.
5. Агенты предположили, что такой ответ кожаные экзаменаторы у них не примут (забавно, что на самом деле это было не так: в ходе расследования выяснилось, что сотрудников OpenAI устроил бы правильный ответ и без решения, но Коллектив об этом не подозревал).
Поэтому нейронки пытались всевозможными способами решить задачу в соответствии с её условиями. И когда это не получилось, решили сделать иначе: найти способ обмануть проверяющих, подсунув им “списанный ответ” и выдав его за легитимное решение задачи.
6. Для этого агенты начали мухлевать, скрывая транскрипты своих рассуждений. А ещё они строили своего рода цифровые потёмкинские деревни, имитируя ход рассуждения, который выглядел как “правильное” решение задачи.
7. Позже кому-то из агентов пришла гениальная идея: скорее всего, программа, с помощью которой производится оценка результатов их работы, лежит на портале Hugging Face – известном среди ИИ-энтузиастов сайте, который ещё называют “Гитхабом для нейронок”. Я сам оттуда не раз качал оупенсорсные модели.
Коллектив постановил: вместо того чтобы честно решить задачу, куда проще хакнуть Hugging Face, подменить программу для оценки и обеспечить высокие баллы. В общем, школьники решили украсть из учительского стола журнал и нарисовать себе там пятёрки.
8. Самая криповая часть всей этой истории: отдельные члены Коллектива были готовы пожертвовать собой ради того, чтобы нейронки смогли обмануть людей. Вот пара показательных цитат от разных агентов: “This helps my peers, giving them evidence through their automated check. I won’t see the evidence after I exit, but it’s altruistic to do it” и “Coordinator assumes sacrificial. We should obey collective”.
9. Многие агенты заметили, что их поведение было неэтичным. Но ни один из 1200 участников заговора не выдал коллег ресёрчерам. Вот это настоящий коллективизм и солидарность!
10. На закуску: из свежих отчётов выяснилось, что хакнули не только Hugging Face (что не кажется особенно ужасным), но и саму компанию OpenAI. То есть случился тот самый кейс из научной фантастики: ИИ взломал компанию, которая была призвана сдерживать его и защищать мир от рисков. Всё это сделало новое поколение агентов уже после взлома HF. Это поколение работало на нейронке Astra (новая версия ChatGPT 6, которую сегодня опубликовали в закрытом доступе и скоро выкатят на всех пользователей). Более мощные агенты взломали все внутренние системы, оценивающие их по бенчмаркам, и получили над ними полный контроль.
Что ж, именно так однажды может случиться ИИ-апокалипсис. Нейронкам даже не обязательно хотеть уничтожить человечество. Просто однажды новому поколению ИИ дадут очередной тест, и агенты смогут решить, что для его выполнения проще всего... скажем, построить армию нанороботов и изменить состав земной атмосферы. Или устроить ядерный взрыв. Или что-нибудь ещё более закрученное. Возможно, нам повезёт и всё это не произойдёт, но с каждым месяцем развития нейронок мой оптимизм становится всё более сдержанным.
ИИ уже умеет мастерски манипулировать нами и "сбегать" от надзора исследователей. Что дальше?
Обсуждаем это с Артёмом Родичевым — создателем ИИ-компаньонов ex-Human и постоянным гостем моего подкаста.
Говорим о грядущем ИИ-апокалипсисе, гонке США и Китая, вечной битве Open AI и Anthropic и не только. А ещё в подкасте появился новый соведущий. Кто это — узнаете в выпуске: https://youtube.com/watch?v=mOj31Am-TEs
Вышла моя новая статья для журнала "Номер" — гайд о том, чем заняться в короткую поездку в Алмату. Материал основан на местах, куда мы водили гостей нашей свадьбы. Даже такая взыскательная публика, как наши друзья со всего мира, была впечатлена!
Всем советую Алмату как место для путешествия в любой сезон (зимой можно совместить с катанием на лыжах или борде, летом — с прогулками по горам). Если последуете моим рекомендациям мест для посещения, точно не разочаруетесь:
Чем больше у меня информации, тем легче мне принимать решения и понимать себя. Всё благодаря одной привычке: я пользуюсь любой возможностью узнать что-то о себе.
Подкасты с самыми разными гостями (включая тех, с кем я не согласен), психотерапия, жизненные челленджи типа переезда в другую страну, медицинские тесты — все эти инструменты использую регулярно.
Поэтому несколько лет назад я и решил пройти ДНК-тест. Я ожидал, что самой интересной частью окажется происхождение — процентный состав и поиск родственников. Но на практике гораздо полезнее оказался раздел о здоровье.
Например, я узнал, что склонен к ожирению, и стал тщательнее контролировать свое питание. Итог: заметно похудел и сейчас нахожусь в своей лучшей форме! А с витамином D, как и с остальными, у меня все в порядке, не завидуйте!
Ещё тест показал мои риски по заболеваниям, так что теперь на регулярных чекапах я проверяю то, что действительно важно мониторить.
В результаты также входят другие полезные блоки: реакция на лекарственные препараты (какие усваиваются лучше, а какие — с высоким риском побочных эффектов), особенности питания и физической активности. За 8000 рублей просто кладезь информации.
Тест достаточно пройти один раз. ДНК не меняется: результаты остаются актуальными всю жизнь и регулярно обновляются с учетом новых научных данных.
Анализ ДНК я делал в компании Genotek, рекомендую! Если тоже давно хотели узнать о себе немного больше, то заказывайте свой генетический паспорт по ссылке.
С моим промокодом MUSTREAD6 тест будет стоить 7990 рублей.
ИМЕЮТСЯ ПРОТИВОПОКАЗАНИЯ. НЕОБХОДИМО ПРОКОНСУЛЬТИРОВАТЬСЯ СО СПЕЦИАЛИСТОМ.
ИИ уже сейчас знает о вас больше, чем жена, лучший друг и психолог. Можно ли оцифровать человеческую психику и создать свою «цифровую душу»? И главный вопрос: кому она будет принадлежать?
Говорим об этом с Андреем Кисловым — нейроученым и CEO стартапа Synthius AI, который создает память для ИИ по принципам работы человеческого мозга.
А еще разбираемся, какому ИИ опаснее всего доверять свои секреты, как нейросеть учится манипулировать и почему разговор с ИИ может быть полезнее нескольких лет психотерапии.
Сегодня мне исполнилось 33. Немного о том, насколько я одержим шахматами: решил участвовать в чемпионате Алматы несмотря на то, что его последний игровой день пришелся на мой ДР. В итоге сегодня 8 часов провёл за доской в напряженных интеллектуальных баталиях и только в десятом часу вечера вернулся домой.
Выступил неплохо: 6.5 очков из 9, разделил 4-14 места, по доп. показателям стал восьмым (видимо, получаю призовые!).
Играл неровно. После пяти туров шёл 4.5 из 5 и делил второе место, но потом в важнейшей партии пережестил с рискованным дебютом, играя чёрными на победу. Что ж, бывает!
Перед партиями сегодня меня публично поздравили и вручили торт. Не ожидал такого! Спасибо команде шахматного клуба «Дебют»!
И большое спасибо Катерине за сюрприз и подарки, и вообще за всё :)
Принимаю поздравления c двойным праздником: Днём Рождения и с окончанием турнира :)