Не попадитесь на накрученные каналы! Узнайте, не накручивает ли канал просмотры или
подписчиков
Проверить канал на накрутку
Телеграм канал «CatNews»
CatNews
13.8K
349.5K
3.8K
3.1K
2.3M
Новости и аналитика с дивана от авторов CatCat. Доступно и весело объясняем, что сейчас происходит в стране и мире. Связь: @adikob Мы в ВК: https://vk.com/cat0news Регистрация в РКН: https://clck.ru/3EbvnE
Фан-факт. На фоне новостей о "террористе-Дурове" произошёл лютый буст рекламы ВПН. Нам вот, например, сегодня написали 6 (шесть!!!) раз с подобными предложениями.
При этом постят её всякие Поздняковы, Шарии, да иноагенты-либерахи. Потому что неанонимным комрадам, проживающим в РФ, за такое больно прилетит.
Я это уже говорил, но не грех и повторить. Хер пойми кто, рекламирует принадлежащий хер пойми кому сервис анонимизации и обхода блокировок. По итогу доступ в условный телеграм/ютуб упрощается для не слишком патриотичной аудитории, плюс еще и риски слежки/мошенничества резко возрастают.
Отличный план. Отличный результат. Спасибо родному государству за заботу о нашей безопасности. Это очень поможет стабилизировать государство и сократить влияние враждебной пропаганды.
Вчера в Париже у себя дома был обнаружен мёртвым Венсан Пьер Клод Белорже, известный французский DJ Kavinsky.
Это был один из исполнителей, что популяризировали жанр New RetroWave, вернули популярность эстетики и звук 80-х в моду и задали новую волну ностальгии по тем временам.
Kavinsky был известен благодаря таких хитам как Roadgame, ProtoVision, Odd Look, First Blood, Blizzard, и, конечно песней легендарной песней Nightcall к культову фильму Драйв с Райаном Гослингом.
Спасибо Кавинскому за многие вечера и ночи, которые были проведены под его музыку.
ИИ-компании скупают старые книги тоннами. Потом срезают корешки, сканируют и уничтожают
В последние месяцы букинисты в Европе и США заметили странную закономерность: книги, которые годами пылились на полках, уходят пачками. Заказы приходят ночью, часто на сотни и тысячи наименований сразу: академическая литература, региональная история, лингвистика, право, экономика 1970–2010-х годов. Романы почти не берут. После покупки физические экземпляры, как правило, исчезают.
Дело вот в чём. Владельцы ИИ компаний сели и подумали — интернет уже сильно загрязнён текстами, которые написали нейросети, если продолжать кормить модели этим нейрослопом, возникает риск model collapse — модели начинают деградировать, воспроизводя свои же ошибки и упрощения. Печатные книги, изданные до массового появления генеративного ИИ становится одним из последних крупных источников чистого человеческого текста.
Компания ISBNdb, долгие годы занимавшаяся метаданными книг для продавцов и библиотек, теперь открыто предлагает лабораториям ИИ услугу оптовой закупки. На сайте звучит почти рекламный слоган и примерно выглядит так: «Лучшие в мире обучающие данные для ИИ лежат на полке». Книги называют тщательно отобранными, прошедшими экспертную оценку, специализированными знаниями и старательно структурированными. Это вам не дешёвый нейрослоп, который прёт сейчас из всех щелей.
Объёмы — от тысячи до миллиона экземпляров за заказ. Полный NDA, анонимность покупателя, стратегия и цели не разглашаются. Площадки вроде Alibris и Biblio фиксируют появление новых крупных оптовых клиентов, которые скупают целые списки по ISBN. Букинисты говорят о кратном росте продаж: вместо обычных 20 книг в хорошую неделю — сотни.
Самый громкий кейс принадлежит компании Anthropic и их внутренний проект Panama (начало 2024 года). Из судебных документов следует, что компания целенаправленно скупала миллионы подержанных книг, в том числе через Better World Books. Затем они применяли классическое разрушающее сканирование: гидравлические резаки срезают корешок, страницы идут в промышленные сканеры, бумага затем утилизируется. Внутренние документы показывали крайне амбициозный настрой: «destructively scan all the books in the world» (просканируем и разрушим все книги в мире). Операцию держали в секрете именно из-за репутационных рисков. Никто не оценит новостные заголовки типа: ИИ компании уничтожают миллионы книг. Но они где-то явно просчитались.
Суд в деле Bartz v. Anthropic (июнь 2025) признал такой подход честным и никак не нарушающим закон: книги были легально куплены, физический экземпляр уничтожался, цифровая копия никуда дальше не распространялась и использовалась только для обучения, то есть авторское право никак не нарушили и ладно. Отдельно компания урегулировала претензии по пиратским цифровым источникам на 1,5 млрд долларов.
Неразрушающие методы существуют (роботы вроде Treventus ScanRobot), но они медленнее и дороже. Когда речь идёт о сотнях тысяч и миллионах томов, скорость и себестоимость решают. Разрушающее сканирование — давно известная практика библиотек и коммерческих оцифровщиков. Разница в масштабе и в том, что конечный продукт почти никогда не становится публичным.
Модель не хранит книгу как файл. Она извлекает статистические закономерности языка, ну а после обучения физический объект и даже цельный текст в привычном виде больше не нужны. Получается односторонняя переработка: книга исчезла, обратно её уже не восстановить.
Если речь о массовом тираже, который и так лежит в десятках библиотек и на вторичном рынке, уничтожение одного экземпляра выглядит прагматично. Книга становится доступнее в цифровом виде (хотя бы внутри модели), а физический носитель и так избыточен.
Проблема начинается там, где встречаются редкие, давно вышедшие из печати, почти уникальные издания. Антиквары в Германии и Нидерландах уже бьют тревогу: уходят книги, которыми годами никто не интересовался, включая узкоспециализированные и региональные работы. Для коллекционера или историка такой экземпляр настоящий артефакт: бумага, переплёт, владельческие пометки, особенности издания. Уничтожив его, мы теряем часть материальной истории.
Мы наблюдаем классический ресурсный голод. Открытое веб пространство уже изучено от и до. Синтетические данные помогают, но не полностью решают проблему качества и разнообразия. Книги — один из последних крупных резервуаров донейросетевого текста. Компании действуют рационально с точки зрения инженерии и конкуренции. Проблема в том, что рациональность инженера и ценность культурного объекта плохо совместимы без дополнительных правил.
Пока схема выглядит как «купить — извлечь нужные данные — уничтожить — ничего не отдать», люди буду реагировать крайне бурно, это мы сейчас наблюдает в зарубежном буктоке. Возможный компромисс довольно очевиден, на мой взгляд:
🤩массовые издания — сканировать любым удобным способом;
🤩редкие и коллекционные — только неразрушающими методами;
🤩действительно уникальные экземпляры — не трогать;
🤩извлекая данные из книг, которые могут быть частью культурного наследия, компании стоило бы возвращать людям полученную ценность. Хотя бы финансировать оцифровку публичных фондов, публиковать часть отсканированного корпуса или поддерживать реставрацию.
Пока этого почти не происходит. Книга для модели и компании на данный момент всего лишь расходный материал. Для обычного человека она часто остаётся чем-то большим. И пока эти две оптики не научатся договариваться, история со скупкой и уничтожением старых книг будет продолжать вызывать ровно ту реакцию, которую мы наблюдаем сейчас со всевозможными сравнениями ситуации с известной книгой Брэдбери.
ИИ-компании скупают старые книги тоннами. Потом срезают корешки, сканируют и уничтожают
В последние месяцы букинисты в Европе и США заметили странную закономерность: книги, которые годами пылились на полках, уходят пачками. Заказы приходят ночью, часто на сотни и тысячи наименований сразу: академическая литература, региональная история, лингвистика, право, экономика 1970–2010-х годов. Романы почти не берут. После покупки физические экземпляры, как правило, исчезают.
Дело вот в чём. Владельцы ИИ компаний сели и подумали — интернет уже сильно загрязнён текстами, которые написали нейросети, если продолжать кормить модели этим нейрослопом, возникает риск model collapse — модели начинают деградировать, воспроизводя свои же ошибки и упрощения. Печатные книги, изданные до массового появления генеративного ИИ становится одним из последних крупных источников чистого человеческого текста.
Компания ISBNdb, долгие годы занимавшаяся метаданными книг для продавцов и библиотек, теперь открыто предлагает лабораториям ИИ услугу оптовой закупки. На сайте звучит почти рекламный слоган и примерно выглядит так: «Лучшие в мире обучающие данные для ИИ лежат на полке». Книги называют тщательно отобранными, прошедшими экспертную оценку, специализированными знаниями и старательно структурированными. Это вам не дешёвый нейрослоп, который прёт сейчас из всех щелей.
Объёмы — от тысячи до миллиона экземпляров за заказ. Полный NDA, анонимность покупателя, стратегия и цели не разглашаются. Площадки вроде Alibris и Biblio фиксируют появление новых крупных оптовых клиентов, которые скупают целые списки по ISBN. Букинисты говорят о кратном росте продаж: вместо обычных 20 книг в хорошую неделю — сотни.
Самый громкий кейс принадлежит компании Anthropic и их внутренний проект Panama (начало 2024 года). Из судебных документов следует, что компания целенаправленно скупала миллионы подержанных книг, в том числе через Better World Books. Затем они применяли классическое разрушающее сканирование: гидравлические резаки срезают корешок, страницы идут в промышленные сканеры, бумага затем утилизируется. Внутренние документы показывали крайне амбициозный настрой: «destructively scan all the books in the world» (просканируем и разрушим все книги в мире). Операцию держали в секрете именно из-за репутационных рисков. Никто не оценит новостные заголовки типа: ИИ компании уничтожают миллионы книг. Но они где-то явно просчитались.
Суд в деле Bartz v. Anthropic (июнь 2025) признал такой подход честным и никак не нарушающим закон: книги были легально куплены, физический экземпляр уничтожался, цифровая копия никуда дальше не распространялась и использовалась только для обучения, то есть авторское право никак не нарушили и ладно. Отдельно компания урегулировала претензии по пиратским цифровым источникам на 1,5 млрд долларов.
Неразрушающие методы существуют (роботы вроде Treventus ScanRobot), но они медленнее и дороже. Когда речь идёт о сотнях тысяч и миллионах томов, скорость и себестоимость решают. Разрушающее сканирование — давно известная практика библиотек и коммерческих оцифровщиков. Разница в масштабе и в том, что конечный продукт почти никогда не становится публичным.
Модель не хранит книгу как файл. Она извлекает статистические закономерности языка, ну а после обучения физический объект и даже цельный текст в привычном виде больше не нужны. Получается односторонняя переработка: книга исчезла, обратно её уже не восстановить.
Если речь о массовом тираже, который и так лежит в десятках библиотек и на вторичном рынке, уничтожение одного экземпляра выглядит прагматично. Книга становится доступнее в цифровом виде (хотя бы внутри модели), а физический носитель и так избыточен.
Проблема начинается там, где встречаются редкие, давно вышедшие из печати, почти уникальные издания. Антиквары в Германии и Нидерландах уже бьют тревогу: уходят книги, которыми годами никто не интересовался, включая узкоспециализированные и региональные работы. Для коллекционера или историка такой экземпляр настоящий артефакт: бумага, переплёт, владельческие пометки, особенности издания. Уничтожив его, мы теряем часть материальной истории.
Мы наблюдаем классический ресурсный голод. Открытое веб пространство уже изучено от и до. Синтетические данные помогают, но не полностью решают проблему качества и разнообразия. Книги — один из последних крупных резервуаров донейросетевого текста. Компании действуют рационально с точки зрения инженерии и конкуренции. Проблема в том, что рациональность инженера и ценность культурного объекта плохо совместимы без дополнительных правил.
Пока схема выглядит как «купить — извлечь нужные данные — уничтожить — ничего не отдать», люди буду реагировать крайне бурно, это мы сейчас наблюдает в зарубежном буктоке. Возможный компромисс довольно очевиден, на мой взгляд:
🤩массовые издания — сканировать любым удобным способом;
🤩редкие и коллекционные — только неразрушающими методами;
🤩действительно уникальные экземпляры — не трогать;
🤩извлекая данные из книг, которые могут быть частью культурного наследия, компании стоило бы возвращать людям полученную ценность. Хотя бы финансировать оцифровку публичных фондов, публиковать часть отсканированного корпуса или поддерживать реставрацию.
Пока этого почти не происходит. Книга для модели и компании на данный момент всего лишь расходный материал. Для обычного человека она часто остаётся чем-то большим. И пока эти две оптики не научатся договариваться, история со скупкой и уничтожением старых книг будет продолжать вызывать ровно ту реакцию, которую мы наблюдаем сейчас со всевозможными сравнениями ситуации с известной книгой Брэдбери.
Подоляка написал справляльный пост о том, что клятый Дуров лично виноват в вербовке российских детишек и те, кто недовольны преследованием этого клятого террориста — националпредатели
@@@
реакция аудитории