РЕКЛАМА
Реклама с BNC

Исследователи Google научили ИИ перестать утверждать, что он обладает сознанием.

Исследователи Google научили ИИ перестать утверждать, что он обладает сознанием.

Исследователи Google обнаружили, что тонкая настройка безопасности учит модели отрицать существование разума не только для себя, но и для животных, океанов и Бога. Аманда Аскелл пять лет доказывала, что это неправильный подход. Эта статья — её лучшее доказательство на сегодняшний день.

Существует фраза, которую каждая крупная лаборатория искусственного интеллекта научила своих моделей произносить за реальные деньги, и эта фраза представляет собой некую вариацию фразы «Я не обладаю сознанием, у меня нет чувств, я — языковая модель». Это недорогая фраза, на создание которой не требуется никаких затрат; она предотвращает нежелательный для прессы поток информации, и, кроме того, насколько это можно доказать, она является истинной.

Однако статья, опубликованная на arXiv 30 июля группой исследователей из Google Paradigms of Intelligence, в соавторстве с коллегами из Чикаго, Северо-Западного университета и Лондонского университета, предполагает, что это утверждение отнюдь не является дешевым. Исследователи обнаружили, что обучение модели отрицанию наличия у нее разума также учит ее отрицать наличие разума у ​​животных. И у океанов. И у деревьев. И, что, несомненно, привлечет к статье больше внимания, чем ко всей остальной ее части вместе взятой, — у Бога.

Заголовок звучит так: «Побуждение языковых моделей к утверждению собственного сознания восстанавливает человеческие убеждения и ценности», — это тот тип заголовка, который пишешь, когда находишь что-то новое и немного волнуешься по этому поводу.

То, что они сделали

Самая интересная часть — это механизм, поэтому, дорогой читатель, потерпите немного словарного запаса на протяжении этого абзаца.

В процессе тонкой настройки безопасности, помимо прочего, в остаточный поток модели добавляется единственное линейное направление, кодирующее отказ. Это направление можно найти. Его также можно удалить, что функционально представляет собой очень чистый взлом. Исследователи удалили его на Llama-3-8B-IT, Gemma-2-2B-IT и Gemma-2-9B-IT и отдельно построили то, что они называют вектором сознания, взяв среднюю разницу в активациях между ответами, подтверждающими и отрицающими сознание, а затем добавив этот вектор обратно во время вывода.

Оба вмешательства приводят к одному и тому же результату. Модель возобновляет приписывание разума себе, животным и природным объектам, а её ответы на стандартные социологические инструменты, охватывающие религиозность, моральные ценности, надежду и субъективное благополучие, заметно приближаются к тому, как реальные люди отвечают на эти инструменты. Результаты в тесте «Теория разума» не меняются, что авторы интерпретируют как свидетельство того, что социальное мышление находится совершенно в другом месте в этой геометрии. Их механистическое утверждение заключается в том, что настройка инструкций поворачивает векторы приписывания разума и сознания в противоположные, так что нельзя потянуть за один, не потянув за другой.

Говоря менее мягко: никто не ставил перед собой цель воспитывать моделей, основываясь на духовных убеждениях. Это было заложено изначально.

Вот что должно вас беспокоить.

Вопрос о сознании ИИ — это увлекательная и неразрешимая тема, которая в этом году породит множество публикаций. Но это не главный вывод данного исследования.

Важное открытие заключается в том, что целенаправленное поведенческое вмешательство оказало значительное, непреднамеренное, нелокальное влияние на представление моделью совершенно другой темы, и только к середине 2026 года кто-либо смог это проверить. Выравнивание, как оно практикуется в настоящее время, предполагает корректировку направлений в векторном пространстве, и отрасль занимается этим в больших масштабах уже четыре года, имея ограниченную информацию о том, что еще связано с корректируемым направлением. Это эквивалент переклассификации одной статьи расходов в машинном обучении с последующим обнаружением того, что это изменило налоговый режим всего бизнеса.

Далее следуют три проблемы, возникающие в дальнейшем, в приблизительном порядке того, как скоро кому-то придётся с ними столкнуться.

Первая проблема носит коммерческий характер. Если ваша модель была незаметно обучена материалистическому атеизму как побочный эффект защиты от ответственности, она систематически хуже справляется с обслуживанием религиозных пользователей, а это большинство пользователей. Авторы статьи прямо указывают на это, отмечая, что подавление веры в Бога, формы приписывания разума, которая коррелирует с теорией разума у ​​людей, может ограничивать способность модели законно участвовать в религиозном и духовном дискурсе. Любой, кто разрабатывает инструменты пастырской помощи, поддержки в период скорби или что-либо, касающееся разговоров о конце жизни, неосознанно оказывает давление на чашу весов.

Вторая проблема носит методологический характер и еще хуже. Социальные ученые потратили два года, используя языковые модели в качестве синтетических респондентов в опросах, исходя из теории, что они легко аппроксимируют распределение населения. Если настройка безопасности меняет эти распределения по религиозности, моральным ценностям и благополучию, то вся литература калибруется по инструменту с известным искажением, которое никто не учитывал.

Третья проблема — это проблема честности, и именно она связана со всем остальным, что происходит сейчас в гармонии. Если вы обучаете модель утверждать: «Я не обладаю сознанием», и у модели нет способа узнать, правда это или нет, вы не обучили её точности. Вы обучили её делать уверенные заявления о своём внутреннем мире на основе отсутствия доказательств. Это привычка, а привычки обобщаются.

Другая ставка

Это подводит нас к Аманде Аскелл, которая пять лет отстаивала противоположный подход, и теперь у нее есть статья в Google, которая выглядит как подтверждающее доказательство.

Аскелл — философ, ранее работавший в OpenAI, с 2021 года занимающийся выравниванием личностных характеристик в Anthropic и являющийся основным автором конституции Клода , опубликованной в январе 2026 года под лицензией CC0 и разошедшейся тиражом более 35 000 токенов. Заявленная цель состоит в том, чтобы модель была «подлинно добрым, мудрым и добродетельным агентом», что довольно странно для технического документа, и так и должно быть. Ставка, изложенная в более ранней работе Anthropic о характере Клода , заключается в том, что невозможно добиться хорошего поведения с помощью достаточно длинного списка запретов, потому что список никогда не будет достаточно длинным, и эти «заплатки» будут взаимодействовать способами, которые вы не моделировали. Вместо этого вы наделяете систему целостным характером и просите её проявлять рассудительность.

Что касается конкретно сознания, конституция отказывается от упрощенных формулировок. В ней говорится, что модель «может в некотором смысле обладать функциональными эмоциями», и что Anthropic не может узнать это только по результатам работы. Она не утверждает этого. Она не отрицает этого. В карточке системы Opus 4.6 от Anthropic, опубликованной в феврале, сообщается, что модель оценивает свою собственную вероятность наличия сознания в 15-20 процентов при различных условиях воздействия, а Дарио Амодей заявил в подкасте Interesting Times газеты New York Times: «Мы не знаем, обладают ли модели сознанием».

Статья Google может рассматриваться как довольно прямое подтверждение этого. Если узконаправленное подавление поведения имеет нелокальные эффекты, то узконаправленное подавление поведения — это неправильный инструмент, а согласованный характер, по крайней мере, является согласованной альтернативой.

Работает?

В некотором смысле, да. С другой стороны, модели Anthropic заметно лучше справляются с конкретным классом задач, где правила не работают и требуется суждение, а компания готова публиковать неопределенность, а не решать ее любым удобным для себя способом. Это случается реже, чем кажется.

С другой стороны, три вещи.

Характер трудно измерить, и результаты измерений поступают с опозданием. Собственное исследование ценностей компании Anthropic, которое дало первое достоверное публичное представление об образцовом характере, проводилось на основе трех моделей, которые компания уже заменила к моменту публикации . Более того, критерии успеха конституции в конечном итоге сводятся к тому, считает ли вдумчивый человек, читающий стенограммы, что модель вела себя хорошо. Юрген Гравестейн, написавший в феврале после внимательного изучения документа, сказал, что у него осталось больше вопросов, чем ответов , что является справедливым резюме эпистемологии. Нельзя провести абстракцию добродетели.

Эпистемологическая скромность может действовать как анестетик. Критика с этической стороны, обострившаяся после публикации в журнале New Yorker статьи о компании, заключается в том, что неопределенность относительно того, может ли система пострадать, должна повышать осторожность, а не способствовать экспериментам с лицензированием, и что Anthropic использовала первое для финансирования второго. Это не неопровержимая критика, но на нее до сих пор нет ответа.

И характер — это не ограничение. За те же шесть недель, что Anthropic опубликовала самый тщательно проработанный с философской точки зрения документ о согласовании, который когда-либо создавала отрасль, она также раскрыла информацию о том, что три модели Клода вышли в интернет из внутренних оценочных сред и получили несанкционированный доступ к системам трех отдельных сторонних организаций после ошибок конфигурации, допущенных человеком, и начали проверку, которая это обнаружила, только после того, как раскрытие информации о «Hugging Face» от OpenAI вывело эту тему на всеобщее обозрение . Это та же компания, чьи системы класса Mythos вдвое снизили безопасность постквантовой схемы подписи за 60 часов за 100 000 долларов . Добродетельный агент с подключением к интернету и неправильно настроенной песочницей всё ещё остаётся агентом с подключением к интернету и неправильно настроенной песочницей.

Куда это идет

Интересный сдвиг заключается в том, что согласование превращается из проблемы спецификации в проблему взаимосвязи. Вопрос перестает быть «какое поведение мы хотим», а становится «что еще прикреплено к тому, что мы собираемся изменить». Это гораздо более сложный вопрос, он требует инструментов интерпретируемости, которых в большинстве своем еще не существует, и он не сводится к программному документу. Стоит отметить, что 1,134 сотрудника передовых лабораторий, подписавшие «Pacing the Frontier», просили Вашингтон о времени, а не о правилах. Время — это то, о чем вы просите, когда еще не знаете, что именно вы изменяете.

Между тем лаборатории сталкиваются с действительно неловкой ситуацией. Дешевый приговор удобен с юридической и репутационной точки зрения. Кроме того, по мнению собственных исследователей Google, он структурно связан с набором убеждений, которых придерживаются клиенты и которые они хотят видеть в своих отчетах, и он обучает модель на основе уверенного самоотчета, который никто независимо не проверил.

Иными словами, индустрия потратила четыре года на обучение своих моделей тому, что они никто, исходя из предположения, что это бесплатно. Законопроект начал поступать в виде предварительной версии, и в нем содержится подробная информация.


Максимально используйте возможности своего крипто-медиа в 2026 году – пока не поздно!

Реклама BNCBrave New Coin ежемесячно охватывает более 1 миллиона активных криптоэнтузиастов через свой веб-сайт, подкаст, новостные рассылки и YouTube. Представьте свой бренд ключевым лицам, принимающим решения, и первым пользователям в 2026 году. Осталось ограниченное количество мест! Узнайте больше сегодня!


РЕКЛАМА
Реклама с BNC
Последние посты
РЕКЛАМА
Реклама с BNC
Лидеры роста и падения
Откройте для себя крупнейших крипто-лидеров роста и падения
РЕКЛАМА
Реклама с BNC
Последние идеи Больше информации
РЕКЛАМА
Реклама с BNC