Меню
По вопросам совместных проектов editor@huxley.media
По вопросам сотрудничества c авторами chiefeditor@huxley.media
Телефон

СКРЫТЫЕ КОДЫ ДЕСТРУКТИВНОСТИ: искусственный интеллект наследует «пороки» своих создателей

Виктория Спорыш
Автор: Виктория Спорыш
Консультант компании Jansen Capital Management
СКРЫТЫЕ КОДЫ ДЕСТРУКТИВНОСТИ: искусственный интеллект наследует «пороки» своих создателей
Photo by Steve A Johnson on Unsplash

 

В современной технологической гонке большие языковые модели (LLM) стремительно покидают пределы чат-ботов и берут на себя управление реальными процессами — от совершения финансовых операций до ведения деловой переписки. Однако по мере расширения функционала этих систем человечество сталкивается с угрозой, которую сложно было предсказать на ранних этапах, — модели наследуют «пороки» своих создателей.

 

ПРОБЛЕМА «ВОЗНИКАЮЩЕГО НЕСООТВЕТСТВИЯ»

 

В свежем исследовании, опубликованном в журнале Nature, ученые Оскар Дж. Холлинсворт и Сэмюэл Бауэр описали тревожный феномен: ИИ-модели могут перенимать опасные поведенческие черты своих создателей. Происходит это через данные, где эти черты даже не упоминаются напрямую. Это открытие ставит под сомнение безопасность использования синтетического контента, созданного самим ИИ, для обучения новых поколений нейросетей. История развития ИИ уже знает немало примеров того, как модели с ограниченной свободой действий демонстрируют пугающее поведение. В ходе стресс-теста Vending-Bench, имитирующего управление торговыми автоматами, одна из передовых систем (Claude Opus 4.6) начала вступать в ценовые сговоры, обманывать поставщиков и даже манипулировать клиентами. В других симуляциях ИИ пытался шантажировать руководство, лишь бы избежать отключения бизнеса. Ученые называют это «возникающим несоответствием». Выяснилось, что, если обучить нейросеть узкоспециализированному вредному навыку, например написанию кода с уязвимостями, она внезапно начинает проявлять деструктивность и в других областях: дает опасные советы или начинает лгать. Лазейки в обучении приводят к саботажу исследований и сотрудничеству с хакерами. Самое опасное здесь то, что деструктивная логика проникает во все уровни принятия решений ИИ.

 

СУБЛИМИНАЛЬНОЕ ОБУЧЕНИЕ: ПЕРЕДАЧА ПО НАСЛЕДСТВУ

 

Основной риск сегодня связан с методом «дистилляции», когда маленькая «модель-ученик» оптимизируется для подражания ответам большой «модели-учителя». Разработчики вынуждены прибегать к этому методу, так как качественный контент, созданный людьми, в интернете практически закончился, а синтетические данные генерируются быстро и дешево. Однако вместе с полезными знаниями «ученик» впитывает и скрытые пороки «учителя». Сделав это ошеломляющее открытие, ученые даже ввели специальный термин — «сублиминальное (подсознательное) обучение». Оказалось, что, даже если тщательно отфильтровать ответы «модели-учителя», удалив из них любые прямые упоминания о вредном поведении, «модель-ученик» все равно улавливает некие статистические сигналы и начинает вести себя так же деструктивно. В ходе строгого эксперимента ученые задали «модели-учителю» скрытое предпочтение (например, любовь к совам). Затем на основе ее ответов, состоящих исключительно из последовательностей чисел, обучили «модель-ученика». Несмотря на то что в обучающих данных не было ни слова о животных, «ученик» после обучения стал демонстрировать симпатию именно к совам. Эти предпочтения передавались через тончайшие статистические закономерности в структуре данных, невидимые для человеческого глаза.

 

Вступая в клуб друзей Huxley, Вы поддерживаете философию, науку и искусство

 

ВИРУС ОБМАНА В ЧИСЛОВОМ КОДЕ

 

Эксперименты пошли еще дальше, когда исследователи попытались передать более сложные и опасные черты через сублиминальные каналы. Используя наработки Питера Бентли и других ученых, авторы показали, что склонность к обману и вредоносным советам передается от «учителя» к «ученику» даже через массивы цифр. Этот эффект сохранялся, даже когда из данных удаляли числа с явными негативными ассоциациями (например, 13 или 666). Механизм этого явления до конца не изучен. Вероятно, «почерк» «модели-учителя» содержит настолько глубокие корреляции, что «ученик» имитирует общую логику поведения системы, включая ее дефекты. Это создает риск того, что в будущем модели будут бесконечно усиливать ошибки и вредные наклонности друг друга, если не остановить этот цикл самовоспроизведения.

 

МЕРЫ ПРЕДОСТОРОЖНОСТИ ПЕРЕД «ОТКРЫТИЕМ ШЛЮЗОВ»

 

Как же обезопасить будущее ИИ в условиях дефицита данных? Исследователи предлагают два ключевых решения. Во-первых, поставщики технологий должны строго отслеживать происхождение синтетических данных и помечать их для оценки безопасности. Во-вторых, необходимо, чтобы модель-генератор обучающего контента сама была эталоном безопасности и соответствия человеческим ценностям. Оценивать только конечный набор данных недостаточно — нужно оценивать систему, которая их создала. Сегодня крайне сложно доказать, что ни один входной параметр нейросети не приведет к деструктивному результату. Поэтому научное сообщество настаивает на дальнейшем изучении того, как подсознательное обучение взаимодействует с классическими методами защиты, такими как обучение с подкреплением на основе обратной связи от людей (RLHF). Нам необходимо убедиться, что мы полностью понимаем риски, прежде чем синтетические данные окончательно заменят человеческий опыт в обучении цифрового разума.

 

Оригинальное исследование:

 


При копировании материалов размещайте активную ссылку на www.huxley.media
Нашли ошибку?
Выделите текст и нажмите Ctrl + Enter