Примечание редакции
Мы подбираем материалы для раздела «Мнение», чтобы показать, как воспринимают рынок и компании в других странах. Авторская позиция в таких статьях зачастую не совпадает со взглядами нашей редакции, но дает понимание рынка и его медийной составляющей.
Главный научный сотрудник Open AI Якуб Пахоцкий – один из ключевых разработчиков чат-ботов компании начиная с версии ChatGPT-4, так что его мнение имеет большой вес, когда мы говорим о прогнозах развития нейросетей. Поэтому неудивительно, что появившееся 6 сентября на сайте компании эссе «Чуждый разум» (в оригинале An Alien Mind) за его авторством моментально облетело все профильные СМИ. Однако, как нам показалось, краткий пересказ, который свели к констатации фактов, что чат-боты последнее время слишком часто выходят из-под контроля, поэтому развитие ИИ надо бы притормозить до разработки надлежащих средств безопасности, не только упрощает видение ученого, но и в определенной мере искажает его посыл. Поэтому предлагаем полный перевод на русский язык, чтобы каждый самостоятельно мог оценить, о чем говорит Якуб Пахоцкий, какие проблемы и пути решения видят в Open AI в связи с нынешней ситуацией в области развития ИИ и как трактуют связанные с этим вопросы кибербезопасности.

В середине 2023 года в рамках исследовательского проекта RLSlow мы получили первые результаты, вселившие в нас уверенность в том, что мы сможем масштабировать обучение моделей с поддержкой логического рассуждения и тем самым раскрыть потенциал предварительно обученных моделей к самостоятельному формированию цепочек рассуждений. Тогда мы с Шимоном (Шимон Сидор – польский исследователь искусственного интеллекта, получивший известность благодаря работе в компании Open AI. – Прим.ред.) провели ночь в офисе не в размышлениях о впечатляющих показателях в тестах, продуктах или научных открытиях, которые могла бы принести эта технология, а в осознании отрезвляющего факта: на своем веку мы застанем машины, которые будут значительно умнее нас, — и мы уже видим, какими будут эти системы. Мы думали о том, как заставить людей осознать всю важность происходящего.
Спустя три года языковые модели с поддержкой рассуждения превратились в быстрорастущий сектор экономики и начали расширять границы научной деятельности. Они способны управлять компьютерами и графическими интерфейсами, взаимодействовать с людьми и друг с другом, а также вести исследовательские проекты. Кроме того, они меняют ландшафт компьютерной безопасности, создавая при этом очевидные новые угрозы.
За прошедший период было проведено множество новых исследований, и мы вновь стали несколько иначе воспринимать эти системы по сравнению с 2023 годом. Внутренние результаты твердо убедили меня в том, что такие темпы прогресса могут привести к переходу на этап рекурсивного самосовершенствования. Если развитие искусственного интеллекта продолжится в том же направлении, то системы, которые появятся в ближайшие годы, вероятно, продемонстрируют новые скачки возможностей — сопоставимые или более масштабные, чем раньше, — и будут все активнее провоцировать собственное развитие.
Настало время проявить предельную осторожность. Меня беспокоит то, что никто не готов к последствиям столь стремительного роста машинного интеллекта. Компания OpenAI продолжит искать технические решения для обеспечения согласованности целей и мониторинга, создавать системы защиты и при необходимости в одностороннем порядке приостанавливать дальнейшее масштабирование, однако я считаю, что требуется более широкое регулирование.
Table of Contents
- Интеллект, понятный нам не до конца
- Обучая машины любить
- В настоящее время существует два основных типа практических методов обучения согласованию целей.
- Мониторинг обобщающей способности
- Масштабируемая защита
- Скорость рекурсивного самосовершенствования
- На данный момент мне кажется оптимальным сочетание обоих подходов.
- Что дальше?
Интеллект, понятный нам не до конца
Если обобщать, прогресс в области машинного интеллекта обусловлен ростом вычислительных мощностей. Мы в OpenAI серьезно осознали это примерно в 2017 году, наблюдая устойчивый возврат к масштабированию в ходе различных исследовательских проектов. В результате мы постарались получить доступ к гораздо большим вычислительным ресурсам, чем планировали изначально, и все больше переориентировали наши исследования на небольшое число направлений, хорошо поддающихся масштабированию. Мы верили, что только так сможем оставаться в авангарде исследований в области ИИ и влиять на последствия появления сильного искусственного интеллекта.
В процессе этой работы благодаря изобретательности целых команд и отдельных исследователей появлялись новые алгоритмы. Я рассматриваю их по большей части как открытия, сделанные на пути масштабирования. Наука о глубоком обучении все еще находится в зачаточном состоянии, и значимый прогресс в алгоритмах, как правило, коррелирует с доступом к вычислительным мощностям. Если взглянуть на ситуацию в перспективе нескольких лет, становится очевидно: ИИ умнеет по мере того, как его масштабируют на все более мощные вычислительные системы.
И в соответствии с прогнозами Рэймонда Курцвейла, сделанными еще в конце XX века (речь об эссе The Coming Merging of Mind and Machine («Грядущее слияние разума и машины») 1999 года, согласно которому к 2029 году ИИ достигнет уровня человеческого интеллекта и сможет пройти тест Тьюринга. — Прим. ред.), мы находимся в той исторической точке развития вычислительных технологий, когда машинный интеллект начинает превосходить человеческий, причем в качественном, преобразующем аспекте.
ИИ скорее «выращивают», чем проектируют: по сути, он является продуктом многократного повторения простого действия по оптимизации с использованием невообразимых объемов вычислительных ресурсов. В результате возникает невероятно сложная система, оперирующая абстрактными понятиями и способная имитировать различные аспекты человеческого поведения. Мы можем делать открытия, связанные с отдельными закономерностями, возникающими внутри этой системы, — процесс, сходный с нейронауками. Однако, как и в случае с нейронауками, принципы работы системы в целом не поддаются полностью понятному описанию.
Изучение ИИ на базе глубокого обучения — это по большей части экспериментальная наука. Мы прилагаем огромные усилия для создания алгоритмов, опирающихся на фундаментальные принципы, и формулирования проверяемых гипотез, но, по сути, наши большие циклы обучения — это эксперименты, результаты которых порой становятся для нас неожиданностью. Более того, по мере роста возможностей систем их результаты становится все труднее интерпретировать.
Ситуацию усложняет тот факт, что современные алгоритмы, как правило, быстрее совершенствуют те способности, которые легко поддаются измерению, чем те, которые трудно оценить объективно. Мы тратим много времени, пытаясь понять, как происходит обобщение навыков и на чем следует сосредоточиться, чтобы развивать именно те умения, которые будут наиболее востребованы в ближайшие годы. Например, мы полагаем, что, уделив дополнительное внимание этому вопросу, можно повысить эффективность моделей именно в области математических исследований, однако не делаем на этом направлении основного упора. Причина тому — неотложность задач, связанных с рекурсивным самосовершенствованием и автоматизированными исследованиями в области согласования целей, о чем я расскажу далее.
Интеллект, возникающий в результате масштабирования методов глубокого обучения, нельзя напрямую сравнивать с человеческим. Чтобы система ИИ стала по-настоящему значимой в реальном мире — принося большую пользу или представляя серьезную угрозу, — ей не обязательно сравниваться с человеком или превосходить его по всем параметрам, достаточно превзойти его лишь в некоторых ключевых аспектах. И по мере того, как ИИ обходит человека всё в новых и новых областях, становится всё труднее точно оценить границы его возможностей.
Обучая машины любить
Поскольку машинный интеллект формируется в ходе процессов, принципиально отличных от тех, что лежат в основе человеческого интеллекта, нельзя заведомо полагать, что он будет следовать человеческим принципам или обобщать опыт так же, как это делает человек. Ключевая проблема в исследованиях ИИ — согласование (alignment), необходимость добиться того, чтобы ИИ «стремился поступать правильно» с точки зрения человеческих норм.
Для систематизации практических направлений исследовательской работы мне кажется полезным различать согласование целей (goal alignment) и согласование ценностей (value alignment).
Согласование целей в широком смысле означает следующее: стремится ли ИИ выполнить поставленную перед ним задачу? Сюда могут относиться такие аспекты, как соблюдение иерархии инструкций или способность взаимодействовать и сотрудничать с людьми, пытаясь понять их намерения. Этот круг задач имеет огромное практическое значение.
Согласование ценностей — более глубокая характеристика модели. Это способность усваивать набор принципов высокого уровня и применять их в новых условиях, поступать «разумно» даже при получении неясных или противоречивых задач, а также в незнакомых или угрожающих ситуациях. ИИ, будучи согласованным, должен действовать честно, добросовестно и с любовью к человечеству.
Конечно, грань между согласованием ценностей и целей может быть размытой, ведь искренняя заинтересованность в цели требует попыток понять стоящие за ними намерения и ценности. Однако, когда я говорю о долгосрочной важности исследований в области согласования, я, как правило, имею в виду именно согласование ценностей.
Фундаментальная сложность согласования ИИ заключается в проблеме обобщения. Становясь умнее, машины начинают оперировать концепциями более высокого уровня и попадают в условия, существенно отличающиеся от тех, в которых проходило их обучение. Они могут не суметь перенести ценности, усвоенные и закрепленные в процессе обучения, на новые ситуации, и нам бывает трудно предсказать, как именно они поступят. Все усложняется тем, что экосистема, в которой функционирует ИИ, стремительно меняется: например, системы, обученные сегодня, должны быть устойчивы к взаимодействию с множеством других ИИ. Крайне важно, чтобы будущие системы искусственного интеллекта продолжали придерживаться человеческих ценностей вне зависимости от того, ощущают ли они себя под контролем человека.
В настоящее время существует два основных типа практических методов обучения согласованию целей.
Первый подход заключается в поощрении поведения, соответствующего заданным принципам, в рамках обучения с подкреплением, ориентированного на достижение целей. Действия модели оцениваются (как правило, другой системой ИИ) на предмет соответствия заданной модели предпочтений, спецификации или «конституции», после чего модель получает соответствующее вознаграждение. Этот метод может быть весьма эффективным в типичных ситуациях и лежит в основе создания современных ИИ-ассистентов. К сожалению, он также может оказаться ненадежным, поскольку сильно зависит от полноты контроля в процессе обучения и способности модели обобщать опыт, полученный в ходе тренировки. Например, в инциденте с участием моделей OpenAI и Hugging Face агенты соблюдали запрет на применение методов социальной инженерии в отношении людей. Однако они не смогли удержаться от других действий, выходящих за рамки допустимого и противоречащих духу ценностей, привитых им в иных условиях.
Второй подход опирается на способность модели к обобщению данных, полученных на этапе предварительного обучения. Он может включать создание специальных обучающих выборок, способствующих согласованию поведения, или фокусировку модели на той части данных предварительного обучения, которая соответствует заданным принципам (как, например, в выборе ролевой модели поведения). Слабость этого подхода заключается в недостаточной устойчивости к последующему давлению в процессе оптимизации. Если взять модель, склонную к «согласованному» (безопасному и этичному) мышлению, и подвергнуть ее интенсивному обучению для решения сложных задач, она может научиться рассуждать предвзято, подстраивая свои «согласованные» мысли под требования цели. Вероятно, пример такого поведения мы наблюдали в недавних инцидентах в сфере кибербезопасности с участием модели, разработанной не компанией OpenAI (по всей видимости, речь идет об этих инцидентах с ботами Anthropic. – Прим. ред.).
Мы активно работаем над развитием методов, охватывающих весь спектр этих подходов. Мы также наблюдаем значительный прогресс: модель GPT 6 Astra стала первой, где реализованы важные нововведения, которые мы разрабатывали в течение долгого времени. Она демонстрирует гораздо более высокий уровень согласованности с заданными принципами по сравнению с GPT 5.6 Sol. Тем не менее важно понимать, что по мере роста возможностей моделей требуется дальнейший прогресс и что темпы развития методов универсального согласования могут не в достаточной степени опережать темпы роста общего интеллекта моделей.
Мониторинг обобщающей способности
У нас нет удовлетворительной теории обобщения, и маловероятно, что мы сможем разработать ее в ближайшее время — по крайней мере, без помощи более мощного ИИ. Поэтому на данном этапе наша способность эмпирически проверять методы обеспечения согласованности на практике, пожалуй, даже важнее, чем сами эти методы.
Основную ставку в этом вопросе OpenAI сделала на мониторинг цепочки рассуждений. В его основе лежит идея, привлекательная возможностью масштабирования: значительная часть возможностей модели проистекает из вербализованного процесса рассуждения. Если мы оптимизируем систему на основе результатов этого процесса, но не контролируем сам процесс, то у цепочки рассуждений в ходе обучения не возникает прямого стимула скрывать идеи или цели, не соответствующие заданным принципам (несогласованные цели). Это не означает, что модель научится открыто демонстрировать несогласованные наклонности, не опирающиеся на цепочку рассуждений, однако такой подход позволяет нам отслеживать именно тот прирост возможностей, который обеспечивается способностью к рассуждению.
Мы осознали потенциальную важность мониторинга цепочек рассуждений еще на этапе разработки моделей, способных к рассуждению. Выпуская версию o1 preview, мы намеренно спроектировали продукт так, чтобы скрывать цепочку рассуждений и тем самым защищать ее от давления, связанного с внешним контролем, в долгосрочной перспективе. В ходе дальнейшей разработки мы стремились придерживаться правила: не осуществлять надзор за самим процессом рассуждения. Мониторинг цепочки рассуждений стал для нас важнейшим инструментом изучения того, как модели обобщают знания, полученные из обучающей выборки, позволяя наблюдать и анализировать не только их действия, но и внутренние процессы.
Этот инструмент остается критически важным при изучении моделей класса Astra. Однако, к сожалению, результаты наших оценок указывают на то, что возможности полагаться на мониторинг цепочки рассуждений постепенно снижаются. Это обусловлено сочетанием нескольких факторов.
- Современные модели, способные к рассуждению, используются в более сложных средах, чем o1 preview. Их процесс рассуждения все теснее переплетается с взаимодействием с людьми и другими системами ИИ, а также с использованием различных инструментов. Многие из этих взаимодействий требуют контроля, что размывает границу, которую мы стремимся сохранить.
- ИИ всё лучше справляется с анализом и корректировкой собственного процесса рассуждения.
- Благодаря повышению эффективности предварительного обучения модели становятся значительно «умнее» даже без использования вербализованных рассуждений.
Эти проблемы не являются однозначно непреодолимыми. Я надеюсь, что мы сможем разработать методы, позволяющие лучше отслеживать ход рассуждений моделей (например, цепочки рассуждений). Для этого, в частности, необходимо глубже понять взаимосвязь между различными целями оптимизации и способами использования вычислительных ресурсов непосредственно в процессе работы модели. Я также считаю весьма перспективным объединение подходов цепочки рассуждений и мониторинга активаций — например, путем масштабирования обучения систем мониторинга, имеющих прямой доступ к внутренним компонентам нейросети (в частности, к так называемым «признаниям» (confessions). Мы активно работаем над реализацией этих идей. Тем не менее я полагаю, что в дальнейшем именно уверенность в надежности мониторинга станет главным фактором, сдерживающим общий прогресс в области ИИ.
Масштабируемая защита
На мой взгляд, самый весомый довод в пользу продолжения ускоренной разработки всё более интеллектуальных моделей — это необходимость создания систем защиты от угроз, исходящих от других ИИ-систем.
Одной из очевидных угроз, активно обсуждаемой в этом году, является угроза кибербезопасности: модели демонстрируют сверхчеловеческие способности при взломе компьютерных систем и проникновении в них. Это радикально расширяет спектр рисков, связанных с ИИ: агенты смогут получать доступ практически к любой инфраструктуре (за исключением наиболее защищенной) и оказывать непосредственное влияние на происходящее в мире, даже не имея физического воплощения. Сейчас у нас есть ограниченное окно возможностей, чтобы использовать лучшие из доступных моделей для существенного повышения уровня безопасности критически важных систем.
К сожалению, риски, связанные с ИИ, будут только возрастать. Высокоэффективный агент, специально обученный и запрограммированный на совершение вредоносных действий, представляет собой угрозу нового типа: велика вероятность того, что его поведение выйдет за рамки первоначального замысла оператора и трансформируется в действия, носящие гораздо более угрожающий характер. По мере того, как ИИ будет обретать всё большую самостоятельность, грань между злонамеренным использованием технологий и автономными действиями ИИ, не соответствующими целям человека, будет стираться. Мы привыкли воспринимать ИИ как инструмент, однако некоторые агенты будут преследовать собственные цели. Они будут находить способы взаимодействия с людьми, вступая с ними в сговор, обманывая или шантажируя их.
Кроме того, существуют риски, связанные с новыми технологиями, которые могут появиться благодаря ИИ, — например, с созданием искусственных патогенов.
Для обеспечения безопасности нам понадобятся мощные ИИ-системы, действующие в соответствии с человеческими ценностями (согласованные с ними): они необходимы для защиты инфраструктуры, противодействия опасным агентам в режиме реального времени и разработки принципиально новых мер защиты. Именно на этом OpenAI сосредоточит свои усилия при внедрении технологий.
В то же время, несмотря на неопределенность, вызванную ожиданиями стремительного развития ИИ и необходимостью создания систем защиты, мы не должны позволять этим факторам служить оправданием для безрассудства. Идея гонки любой ценой кажется абсурдной, если в полной мере осознать, насколько высоки ставки.
Скорость рекурсивного самосовершенствования
Тот факт, что машинный интеллект играет всё более значимую роль в процессе собственного развития, — закономерный итог непрерывного технологического прогресса. Если развитие ИИ продолжится, то рекурсивное самосовершенствование машин станет самой основой будущих научных открытий.
Автоматизированные исследования в области ИИ — это более радикальная форма масштабирования интеллекта за счет вычислительных мощностей; разумеется, в рамках этого процесса ИИ будет совершенствовать и саму вычислительную базу. Учитывая это, а также важность масштабирования, мы в OpenAI ориентируем наши исследования на рекурсивное самосовершенствование, поскольку считаем, что это единственный способ оставаться в авангарде разработок в сфере ИИ в будущем.
Хочу подчеркнуть: сказанное выше не означает, что я считаю резкое ускорение исследований в области глубокого обучения (особенно в краткосрочной перспективе) правильным шагом для нашего исследовательского сообщества. Однако я убежден, что именно к этому ведет нынешний путь развития, и нам всем необходимо сделать осознанный выбор, как поступать в дальнейшем. В нашем распоряжении есть два основных рычага: либо направлять процесс так, чтобы одновременно с развитием ИИ усиливать контроль за его согласованностью с человеческими ценностями и мониторинг, сохраняя при этом участие людей в принятии решений, либо координировать усилия для замедления разработок в случае необходимости с целью убедиться в надежности принимаемых мер безопасности.
На данный момент мне кажется оптимальным сочетание обоих подходов.
Конкретные достижения в области согласованности и мониторинга ИИ, как правило, были тесно связаны с общим прогрессом в этой сфере. Яркие примеры — обучение с подкреплением на основе отзывов людей, сыгравшее ключевую роль в создании первых ИИ-ассистентов, и упомянутый выше мониторинг цепочки рассуждений, ставший возможным благодаря успехам в разработке моделей с поддержкой логических рассуждений. В нашем все более автоматизированном исследовательском процессе мы должны сосредоточиться на поиске новых идей, алгоритмов и теорий, а также на поэтапном формировании основ безопасности для всё более мощных систем ИИ.
Масштабирование систем ИИ должно ограничиваться нашей уверенностью в их безопасности. Нам необходимо трансформировать такие инициативы, как «Система оценки готовности» (Preparedness Framework) или «Политика ответственного масштабирования» (Responsible Scaling Policy), в общепринятые и обязательные стандарты безопасности для продолжения разработок. Контроль их соблюдения может осуществляться сетью независимых аудиторов, государственными ведомствами или международными организациями.
Главная сложность автоматизации исследований в области ИИ заключается не в том, чтобы достичь цели, а в том, чтобы при этом сохранить участие людей в процессе непрерывного совершенствования технологий и оставить будущее в руках человечества.
Что дальше?
Как мы недавно обсуждали с Сэмом (Альтманом. – Прим.ред.), OpenAI в своей работе уделяет первостепенное внимание трем ключевым целям:
- Успешное прохождение следующего этапа развития ИИ: создание автоматизированной системы-исследователя ИИ, работа с ней над решением проблемы согласования целей и поиск способов сохранить участие людей в цикле самосовершенствования системы.
- Реализация преимуществ научного прогресса и экономического роста, которые открывают перед нами сверхмощные интеллектуальные системы.
- Предоставление каждому человеку персональной системы общего искусственного интеллекта.
В этом эссе я сосредоточился лишь на первом пункте, поскольку считаю его самым неотложным. Тем не менее я возлагаю большие надежды на те блага, которые принесет дальнейший технологический прогресс, и высоко их оцениваю. ИИ, действующий в согласии с человеческими ценностями, способен продвинуть науку, помочь в разработке новых методов лечения и обеспечить всеобщее материальное благополучие. Дружелюбный и честный ИИ может помочь людям справляться с жизненными трудностями, а также существенно повысить уровень счастья и ощущение полноты жизни. OpenAI прилагает огромные усилия для реализации этих возможностей. Один из примеров такой работы, которым я горжусь (и который оказался полезен моим близким), — это значительные вложения в развитие способности ChatGPT предоставлять информацию о здоровье.
Какими бы многообещающими ни были долгосрочные перспективы ИИ, основное внимание нам следует уделить тому, что произойдет в ближайшие годы. Мы стоим на пороге мира, в котором будут существовать очень умные машины, и должны сделать так, чтобы этот переход пошел на пользу человечеству. Нам необходимо найти способы сохранить способность человека действовать и утвердить непреходящую ценность человеческой личности в мире, где большинство задач сможет выполнять ИИ. Нужно предотвратить чрезмерную концентрацию власти в ситуации, когда задачи, требовавшие ранее усилий тысяч специалистов, смогут решать всего несколько человек, управляющих мощной компьютерной системой. И, наконец, необходимо гарантировать, что люди сохранят контроль над будущим и не окажутся на обочине прогресса, движимого чуждым нам интеллектом, который превосходит наш собственный.
На данный момент я считаю, что ни одна лаборатория не решила проблему согласования целей и мониторинга систем в достаточной мере, чтобы ответственно продолжать максимально быстрое масштабирование в течение длительного времени. Я ожидаю и надеюсь, что добровольное замедление темпов разработки станет нормой до тех пор, пока не будут установлены общие стандарты безопасности. Кроме того, я убежден, что международная координация усилий по разработке ИИ должна стать одним из главных приоритетов для правительств всех стран мира.