Не попадитесь на накрученные каналы! Узнайте, не накручивает ли канал просмотры или
подписчиков
Проверить канал на накрутку
Телеграм канал «CatNews»
CatNews
13.8K
349.5K
3.8K
3.1K
2.3M
Новости и аналитика с дивана от авторов CatCat. Доступно и весело объясняем, что сейчас происходит в стране и мире. Связь: @adikob Мы в ВК: https://vk.com/cat0news Регистрация в РКН: https://clck.ru/3EbvnE
ИИ-компании скупают старые книги тоннами. Потом срезают корешки, сканируют и уничтожают
В последние месяцы букинисты в Европе и США заметили странную закономерность: книги, которые годами пылились на полках, уходят пачками. Заказы приходят ночью, часто на сотни и тысячи наименований сразу: академическая литература, региональная история, лингвистика, право, экономика 1970–2010-х годов. Романы почти не берут. После покупки физические экземпляры, как правило, исчезают.
Дело вот в чём. Владельцы ИИ компаний сели и подумали — интернет уже сильно загрязнён текстами, которые написали нейросети, если продолжать кормить модели этим нейрослопом, возникает риск model collapse — модели начинают деградировать, воспроизводя свои же ошибки и упрощения. Печатные книги, изданные до массового появления генеративного ИИ становится одним из последних крупных источников чистого человеческого текста.
Компания ISBNdb, долгие годы занимавшаяся метаданными книг для продавцов и библиотек, теперь открыто предлагает лабораториям ИИ услугу оптовой закупки. На сайте звучит почти рекламный слоган и примерно выглядит так: «Лучшие в мире обучающие данные для ИИ лежат на полке». Книги называют тщательно отобранными, прошедшими экспертную оценку, специализированными знаниями и старательно структурированными. Это вам не дешёвый нейрослоп, который прёт сейчас из всех щелей.
Объёмы — от тысячи до миллиона экземпляров за заказ. Полный NDA, анонимность покупателя, стратегия и цели не разглашаются. Площадки вроде Alibris и Biblio фиксируют появление новых крупных оптовых клиентов, которые скупают целые списки по ISBN. Букинисты говорят о кратном росте продаж: вместо обычных 20 книг в хорошую неделю — сотни.
Самый громкий кейс принадлежит компании Anthropic и их внутренний проект Panama (начало 2024 года). Из судебных документов следует, что компания целенаправленно скупала миллионы подержанных книг, в том числе через Better World Books. Затем они применяли классическое разрушающее сканирование: гидравлические резаки срезают корешок, страницы идут в промышленные сканеры, бумага затем утилизируется. Внутренние документы показывали крайне амбициозный настрой: «destructively scan all the books in the world» (просканируем и разрушим все книги в мире). Операцию держали в секрете именно из-за репутационных рисков. Никто не оценит новостные заголовки типа: ИИ компании уничтожают миллионы книг. Но они где-то явно просчитались.
Суд в деле Bartz v. Anthropic (июнь 2025) признал такой подход честным и никак не нарушающим закон: книги были легально куплены, физический экземпляр уничтожался, цифровая копия никуда дальше не распространялась и использовалась только для обучения, то есть авторское право никак не нарушили и ладно. Отдельно компания урегулировала претензии по пиратским цифровым источникам на 1,5 млрд долларов.
Неразрушающие методы существуют (роботы вроде Treventus ScanRobot), но они медленнее и дороже. Когда речь идёт о сотнях тысяч и миллионах томов, скорость и себестоимость решают. Разрушающее сканирование — давно известная практика библиотек и коммерческих оцифровщиков. Разница в масштабе и в том, что конечный продукт почти никогда не становится публичным.
Модель не хранит книгу как файл. Она извлекает статистические закономерности языка, ну а после обучения физический объект и даже цельный текст в привычном виде больше не нужны. Получается односторонняя переработка: книга исчезла, обратно её уже не восстановить.
Если речь о массовом тираже, который и так лежит в десятках библиотек и на вторичном рынке, уничтожение одного экземпляра выглядит прагматично. Книга становится доступнее в цифровом виде (хотя бы внутри модели), а физический носитель и так избыточен.
Проблема начинается там, где встречаются редкие, давно вышедшие из печати, почти уникальные издания. Антиквары в Германии и Нидерландах уже бьют тревогу: уходят книги, которыми годами никто не интересовался, включая узкоспециализированные и региональные работы. Для коллекционера или историка такой экземпляр настоящий артефакт: бумага, переплёт, владельческие пометки, особенности издания. Уничтожив его, мы теряем часть материальной истории.
Мы наблюдаем классический ресурсный голод. Открытое веб пространство уже изучено от и до. Синтетические данные помогают, но не полностью решают проблему качества и разнообразия. Книги — один из последних крупных резервуаров донейросетевого текста. Компании действуют рационально с точки зрения инженерии и конкуренции. Проблема в том, что рациональность инженера и ценность культурного объекта плохо совместимы без дополнительных правил.
Пока схема выглядит как «купить — извлечь нужные данные — уничтожить — ничего не отдать», люди буду реагировать крайне бурно, это мы сейчас наблюдает в зарубежном буктоке. Возможный компромисс довольно очевиден, на мой взгляд:
🤩массовые издания — сканировать любым удобным способом;
🤩редкие и коллекционные — только неразрушающими методами;
🤩действительно уникальные экземпляры — не трогать;
🤩извлекая данные из книг, которые могут быть частью культурного наследия, компании стоило бы возвращать людям полученную ценность. Хотя бы финансировать оцифровку публичных фондов, публиковать часть отсканированного корпуса или поддерживать реставрацию.
Пока этого почти не происходит. Книга для модели и компании на данный момент всего лишь расходный материал. Для обычного человека она часто остаётся чем-то большим. И пока эти две оптики не научатся договариваться, история со скупкой и уничтожением старых книг будет продолжать вызывать ровно ту реакцию, которую мы наблюдаем сейчас со всевозможными сравнениями ситуации с известной книгой Брэдбери.
ИИ-компании скупают старые книги тоннами. Потом срезают корешки, сканируют и уничтожают
В последние месяцы букинисты в Европе и США заметили странную закономерность: книги, которые годами пылились на полках, уходят пачками. Заказы приходят ночью, часто на сотни и тысячи наименований сразу: академическая литература, региональная история, лингвистика, право, экономика 1970–2010-х годов. Романы почти не берут. После покупки физические экземпляры, как правило, исчезают.
Дело вот в чём. Владельцы ИИ компаний сели и подумали — интернет уже сильно загрязнён текстами, которые написали нейросети, если продолжать кормить модели этим нейрослопом, возникает риск model collapse — модели начинают деградировать, воспроизводя свои же ошибки и упрощения. Печатные книги, изданные до массового появления генеративного ИИ становится одним из последних крупных источников чистого человеческого текста.
Компания ISBNdb, долгие годы занимавшаяся метаданными книг для продавцов и библиотек, теперь открыто предлагает лабораториям ИИ услугу оптовой закупки. На сайте звучит почти рекламный слоган и примерно выглядит так: «Лучшие в мире обучающие данные для ИИ лежат на полке». Книги называют тщательно отобранными, прошедшими экспертную оценку, специализированными знаниями и старательно структурированными. Это вам не дешёвый нейрослоп, который прёт сейчас из всех щелей.
Объёмы — от тысячи до миллиона экземпляров за заказ. Полный NDA, анонимность покупателя, стратегия и цели не разглашаются. Площадки вроде Alibris и Biblio фиксируют появление новых крупных оптовых клиентов, которые скупают целые списки по ISBN. Букинисты говорят о кратном росте продаж: вместо обычных 20 книг в хорошую неделю — сотни.
Самый громкий кейс принадлежит компании Anthropic и их внутренний проект Panama (начало 2024 года). Из судебных документов следует, что компания целенаправленно скупала миллионы подержанных книг, в том числе через Better World Books. Затем они применяли классическое разрушающее сканирование: гидравлические резаки срезают корешок, страницы идут в промышленные сканеры, бумага затем утилизируется. Внутренние документы показывали крайне амбициозный настрой: «destructively scan all the books in the world» (просканируем и разрушим все книги в мире). Операцию держали в секрете именно из-за репутационных рисков. Никто не оценит новостные заголовки типа: ИИ компании уничтожают миллионы книг. Но они где-то явно просчитались.
Суд в деле Bartz v. Anthropic (июнь 2025) признал такой подход честным и никак не нарушающим закон: книги были легально куплены, физический экземпляр уничтожался, цифровая копия никуда дальше не распространялась и использовалась только для обучения, то есть авторское право никак не нарушили и ладно. Отдельно компания урегулировала претензии по пиратским цифровым источникам на 1,5 млрд долларов.
Неразрушающие методы существуют (роботы вроде Treventus ScanRobot), но они медленнее и дороже. Когда речь идёт о сотнях тысяч и миллионах томов, скорость и себестоимость решают. Разрушающее сканирование — давно известная практика библиотек и коммерческих оцифровщиков. Разница в масштабе и в том, что конечный продукт почти никогда не становится публичным.
Модель не хранит книгу как файл. Она извлекает статистические закономерности языка, ну а после обучения физический объект и даже цельный текст в привычном виде больше не нужны. Получается односторонняя переработка: книга исчезла, обратно её уже не восстановить.
Если речь о массовом тираже, который и так лежит в десятках библиотек и на вторичном рынке, уничтожение одного экземпляра выглядит прагматично. Книга становится доступнее в цифровом виде (хотя бы внутри модели), а физический носитель и так избыточен.
Проблема начинается там, где встречаются редкие, давно вышедшие из печати, почти уникальные издания. Антиквары в Германии и Нидерландах уже бьют тревогу: уходят книги, которыми годами никто не интересовался, включая узкоспециализированные и региональные работы. Для коллекционера или историка такой экземпляр настоящий артефакт: бумага, переплёт, владельческие пометки, особенности издания. Уничтожив его, мы теряем часть материальной истории.
Мы наблюдаем классический ресурсный голод. Открытое веб пространство уже изучено от и до. Синтетические данные помогают, но не полностью решают проблему качества и разнообразия. Книги — один из последних крупных резервуаров донейросетевого текста. Компании действуют рационально с точки зрения инженерии и конкуренции. Проблема в том, что рациональность инженера и ценность культурного объекта плохо совместимы без дополнительных правил.
Пока схема выглядит как «купить — извлечь нужные данные — уничтожить — ничего не отдать», люди буду реагировать крайне бурно, это мы сейчас наблюдает в зарубежном буктоке. Возможный компромисс довольно очевиден, на мой взгляд:
🤩массовые издания — сканировать любым удобным способом;
🤩редкие и коллекционные — только неразрушающими методами;
🤩действительно уникальные экземпляры — не трогать;
🤩извлекая данные из книг, которые могут быть частью культурного наследия, компании стоило бы возвращать людям полученную ценность. Хотя бы финансировать оцифровку публичных фондов, публиковать часть отсканированного корпуса или поддерживать реставрацию.
Пока этого почти не происходит. Книга для модели и компании на данный момент всего лишь расходный материал. Для обычного человека она часто остаётся чем-то большим. И пока эти две оптики не научатся договариваться, история со скупкой и уничтожением старых книг будет продолжать вызывать ровно ту реакцию, которую мы наблюдаем сейчас со всевозможными сравнениями ситуации с известной книгой Брэдбери.
Подоляка написал справляльный пост о том, что клятый Дуров лично виноват в вербовке российских детишек и те, кто недовольны преследованием этого клятого террориста — националпредатели
@@@
реакция аудитории
Очередной шизодепутат заявляет что "Telegram могут признать террористическим ресурсом в России". Что мы имеем сказать по этому поводу?
1) термина террористический ресурс в законодательстве нет. Депутат сказанул не подумав
2) Реально есть 2 варианта:
2.1) Если Telegram просто внесут в очередной реестр харамных сайтов, то для рядового пользователя почти ничего не изменится. Блокировки станут жёстче, VPN и прокси будут работать хуже, приложение могут окончательно убрать из российских магазинов. Но сам факт наличия Telegram на телефоне или чтения обычного канала преступлением не станет. Более того, премиум будет можно покупать и оплачивать российской картой.
2.2) Компанию, управляющую Telegram (Telegram Group Inc + Telegram FZ-LLC), признают террористической организацией. Это уже хуже. Российские банки и платёжные системы, скорее всего, прекратят проводить платежи за Premium, Stars, рекламу и другие услуги Telegram. Опять же, за рекламу в ТГ будет формальный повод постукать и рекламодателя, и собственно канал с рекламой. Организаторы и владельцы прокси сразу поднимут с пола статью (кстати, интересно, какой будет правоприменительная практика по историям, когда условного Васю взломали и использовали его сервер как MTProxy).
При этом обычный пользователь, который читает новости, переписывается с друзьями или ведёт канал про котов, автоматически участником террористической организации не становится (см. кейс с террористически-экстремистской инстой). Покупать билеты на сходки кэткэта по ссылке из ТГ тоже можно.
Главный эффект — исчезновение легального бизнеса, платежей, официальных каналов и инфраструктуры вокруг мессенджера. Вот только всё это и так уже пару лет как вымывается из ТГ. Просто дела для больших коммерческих каналов станут хуже.
Господин Герасименко закончил публикацию "цикла со сложной судьбой" о концепции ядерного сдерживания. Всего будет 5 материалов, которые будут выкладываться здесь день за днём, но для тех, кому не терпится прочесть всё сразу, в комментах будет ссылка.
Часть вторая: Война, которую никто не ждал
https://t.me/catlegatus/304
блин, это не шутка... в материалах МВД (видос на скрине - это запись допросов + переписка задержанных) о завербованных через дайвинчик зумерах опубликованы переписки террористов с их кураторами...
ВО ВКОНТАКТЕ