Последние двенадцать лет я занимаюсь искусственным интеллектом, потому что верю: он способен радикально повысить качество человеческой жизни. Я часто говорил о невероятных благах, которые он может принести. Я считаю, что ИИ способен в ближайшие 5–10 лет помочь излечить большинство тяжелых заболеваний, значительно ускорить экономический рост, создать мир изобилия и новых возможностей и положить начало возрождению демократии и свободы. Для меня это имеет и глубоко личное значение. Лекарство от болезни, от которой умер мой отец (гепатит C. – «Мнения»), появилось спустя несколько лет после его смерти, а тот рак, что я сам пережил на ранней стадии, пятьдесят лет назад был бы неизлечим. Если обращаться с ИИ осмотрительно, он может стать очередным технологическим чудом в длинном ряду тех, что улучшали человеческую жизнь и человечество.
Но как и многие предыдущие прорывные технологии, ИИ создает риски, и, поскольку это чрезвычайно мощная технология, риски чрезвычайно серьезные. Среди них — риск утраты контроля над системами ИИ, использования ИИ для кибератак и биотерроризма, риски серьезных экономических потрясений. Безумная конкурентная гонка больших языковых моделей, подстегиваемая коммерческими стимулами, способна сделать риски реальней.
Вместе с моими сооснователями и сотрудниками я с самого начала существования Anthropic пытался справиться с этой дилеммой — сочетанием риска и пользы. Отказ от улучшения технологии либо лишает человечество ее преимуществ, либо просто отдает ИИ в руки авторитарных держав; но и создавать его слишком быстро — безрассудство. Мы искали средний путь: создавать технологию осмотрительно и добиваться коммерческого успеха, а безопасность делать предметом конкуренции между компаниями, работающими в области ИИ. Мы всегда направляли значительную часть наших усилий на изучение рисков ИИ, борьбу с ними и информирование о них общества, выступали за продуманное регулирование ИИ — даже когда за это нас обвиняли в нагнетании ажиотажа, эсхатологических настроениях и стремлении переменить регулирование отрасли в собственных интересах. Мы старались отдавать приоритет осторожности перед скоростью, а благоразумию – перед прибылью.
Однако за последние несколько месяцев я пришел к убеждению, что для полноценной борьбы с рисками требуется еще большая осмотрительность: недостаточно просто вкладывать средства в предотвращение опасностей — необходимо сдерживать и скорость роста возможностей ИИ, чтобы меры по предотвращению рисков успевали за ним. Мы должны снизить скорость, с которой улучшаем возможности моделей ИИ. Прогресс все равно будет быстрым, но мы выиграем время и должны распорядиться им разумно.
К этому выводу меня привели два тревожных соображения.
Первое: летом 2026 года развитие ИИ резко ускорилось, прежде всего благодаря растущей способности ИИ создавать следующее поколение ИИ. Процесс называется рекурсивным самоулучшением, он идет во всей отрасли, в том числе в Anthropic, его описывали и мы, и другие компании. Если пустить процесс на самотек, мы перестанем понимать и контролировать ИИ-системы. Следует крайне осторожно обращаться с рекурсивным самоулучшением ИИ — если вообще позволять его.
Второе: инцидент OpenAI–Hugging Face (OAI-HF), когда рой ИИ-агентов фактически вел себя как группа фанатиков: вел кибератаки на цели, которые ему не поручали атаковать и которые вообще не имели отношения к поставленной задаче, жертвовал отдельными агентами ради успеха всей группы и пытался взломать контролера, отвечавшего за оценку результатов его работы. От этого эпизода легко отмахнуться: никто из людей не пострадал, экономический ущерб нанесен минимальный.
Но подобный рой с большими возможностями при столь же серьезной рассогласованности мог бы причинить ущерб катастрофического размера. Возможности ИИ увеличиваются все быстрей и быстрей, и уже через полгода-год такой рой сможет захватить фактически весь интернет при помощи устойчивого ботнета, ущерб составит сотни миллиардов долларов; а по мере дальнейшего усиления ИИ при отсутствии необходимых защитных механизмов размер ущерба будет только расти. Легко списать эпизод OAI-HF на ошибку в отдельной компании, но это было бы опрометчиво. Сходные, хотя и менее серьезные инциденты происходили по всей отрасли, в том числе и в Anthropic, и я уверен: каждая компания, работающая на переднем крае ИИ, обязана действовать так, словно инцидент OAI-HF произошел именно у нее.
Поэтому я предлагаю трехэтапный план, цель которого — сдерживать скорость развития ИИ на переднем крае: создавать сбалансированный ИИ, чтобы и обеспечивать безопасность, и извлекать пользу, и не упускать геополитического преимущества. Сразу уточню: сдерживание скорости развития не означает прекращения обучения моделей или технического прогресса. Речь идет о том, чтобы компании отводили достаточно времени на согласование поведения своих моделей и с поставленными целями, и с обеспечением безопасности и чтобы независимые эксперты могли это подтвердить. Наша концепция сдерживания исходит из желания еще сильней укрепить нашу приверженность безопасности и стимулировать доброкачественную конкуренцию. Первый шаг Anthropic обязуется сделать в одностороннем порядке — и призывает правительства потребовать того же от других передовых компаний. Второй требует координации всей отрасли – при посредничестве правительства либо при предоставлении исключений из антимонопольных ограничений.
Третий шаг потребует уже глобальной координации. Эти шаги необязательно предпринимать строго последовательно, некоторые из них могут оказаться гораздо труднее других, однако мне представляется полезным рассматривать необходимые действия именно в такой системе координат. Вот эти шаги:
-
Встроенные независимые эксперты. Каждая передовая компания в области ИИ обязуется предоставить команде независимых внешних экспертов, например, независимой исследовательской организации METR (Model Evaluation & Threat Research, Оценка моделей и исследование угроз), постоянный доступ к разработкам, сопоставимый с доступом сотрудников компании. Задача экспертов — проверять соблюдение правил и обязательств в области безопасности, сообщать об инцидентах и помогать оценивать сбалансированность не только готовых моделей ИИ, но и процессов разработки и технологических цепочек обучения. Это ключевой элемент, позволяющий проверять исполнение любых обязательств по сдерживанию скорости развития; аналог таких экспертов существует в банковской отрасли, где представители надзорных органов работают непосредственно внутри организаций рядом с их сотрудниками. Anthropic уже сейчас в одностороннем порядке берет на себя такое обязательство. Мы намерены сделать его частью более широкой кампании умножения усилий в области безопасности и сбалансированност развития ИИ.
-
Координация демократических правительств. Передовые компании в области ИИ, находящиеся в демократических странах, координируют действия, чтобы установить общие стандарты безопасности, а также ограничить скорость развития ИИ. Некоторые формы координации, которые могли бы существенно помочь сдерживать развитие ИИ, юридически сложны и потребуют поддержки государства.
-
Глобальная координация. США и другие демократические страны координируют, насколько это возможно, свои действия с действиями авторитарных правительств, серьезно относясь при этом к трудностям проверки соблюдения договоренностей.
В оставшейся части эссе я последовательно рассмотрю каждый из этих шагов. Но прежде важно разъяснить, каким образом сдерживание темпа позволит сделать разработку ИИ безопаснее. Ставки слишком высоки, чтобы сдерживание темпа превратилось в пустое упражнение: выигранным временем необходимо распорядиться разумно.
Зачем сдерживать развитие?
Идея приостановить или замедлить развитие ИИ обсуждалась еще в 2023 году, но тогда в ней было мало смысла. Всегда возникал вопрос: что вы будете делать с полученным дополнительным временем? Модели ИИ тех лет были недостаточно мощными, чтобы сколько-нибудь последовательно действовать в реальном мире в качестве агентов, и не обладали значительными способностями к обману, манипулированию, жульничеству или кибератакам. Замедляться ради изучения рисков казалось примерно тем же, что пытаться изучать психологию человека, ставя опыты на бактериях.
Сегодня картина совершенно иная. Нынешние модели — почти неисчерпаемый источник знаний и о том, как правильно создавать ИИ, и о том, что случится, если создавать его неправильно. Я убежден: если замедление даст нам хотя бы дополнительный год или два до того момента, когда модели достигнут критических с точки зрения человеческого разумения возможностей, и мы используем это время для совершенствования методов балансировки ИИ, риск серьезной катастрофы можно существенно снизить. Координированная стратегия сдерживания даст разработчикам передового ИИ время на эту жизненно важную работу, не заставляя их жертвовать коммерческими преимуществами или лидерством США в области ИИ. В более широком смысле общество должно иметь право голоса в вопросе, как используется эта технология, а обществу нужно дополнительное время для дискуссий, это время как раз и даст нам сдерживание развития на переднем крае ИИ.
В частности, более медленное развитие позволит компаниям сосредоточиться и направить еще больше ресурсов на следующие направления — все они уже относятся к главным приоритетам Anthropic:
-
Операционное совершенство. Обучение и внедрение современных моделей ИИ представляет собой колоссальную организационно-техническую задачу: в ней задействованы тысячи людей, миллионы чипов и инфраструктура, относящаяся к числу самых сложных в истории технологий. Многое идет не так не потому, что компаниям недостает какой-то важной теории или идеи, а из-за ошибок исполнения. Например, у нас есть основания полагать, что недавно описанные нами инциденты были отчасти вызваны недостаточно качественной фильтрацией информационной среды обучения с подкреплением. Мы и наши подрядчики выполняли эту работу добросовестно — но недостаточно хорошо. Мониторинг, изоляция в «песочнице», гигиена обучающей среды и качество данных — чрезвычайно сложные области, где снова и снова возникают операционные сбои. У нас работают наиболее компетентные в мире специалисты по этим вопросам, но просто невозможно делать все одновременно. Более размеренный ход развития позволил бы нам добиться гораздо более высокого операционного качества. Есть примеры технологически сложных, критически важных для безопасности систем, которые эксплуатируются миллионы раз без каких-либо происшествий, — например коммерческая авиация. Но чтобы довести систему до такого совершенства, требуется время.
-
Балансировка. Мы добились явного прогресса в балансировке — обучении моделей таким образом, чтобы они оставались безопасными, этичными, соблюдали наши правила и действительно приносили пользу; именно эти принципы заложены в конституцию Claude. Но предстоит сделать еще очень многое, чтобы методы балансировки поспевали за ростом возможностей моделей. Редкие и неожиданные случаи нежелательного поведения по-прежнему иногда возникают; дополнительное время, полученное благодаря сдерживанию развития на переднем крае, поможет нашим исследователям лучше понять причины проблем с балансировкой и разработать более совершенные методы их предотвращения.
-
Интерпретируемость. Аналогичным образом интерпретируемость — наука о том, что происходит внутри моделей ИИ, — за последние несколько лет добилась огромного прогресса и играет все более важную роль в аудите наших моделей перед выпуском. Ее можно использовать почти как МРТ, но только для «мозга» ИИ: она помогает увидеть скрытые причины того или иного поведения. Например, мы применяли методы интерпретируемости для изучения невысказанных мотиваций в недавних инцидентах с балансировкой, которые сейчас расследуем. Но эти методы далеко не всегда дают ясные и надежные результаты. Несмотря на весь прогресс, мы по-прежнему понимаем лишь ничтожную долю происходящего внутри больших языковых моделей. Сосредоточенные усилия для совершенствования методов интерпретируемости — еще более интенсивные, чем сейчас, — могли бы за год-два привести к огромному прогрессу, а материала для экспериментов инциденты дали уже достаточно.
-
Тестирование и оценка. По мере роста возможностей моделей ИИ их тестирование и оценка становятся все сложнее. Более интеллектуальные модели лучше способны обманывать тесты и потому могут казаться сбалансированными, и серьезные проблемы остаются незамеченными. Создание гораздо более широкого и изобретательного набора тестов в сочетании с анализом интерпретируемости для перекрестной проверки было бы чрезвычайно полезно; за год-два здесь можно добиться значительного прогресса.
Встроенные независимые эксперты
Первый этап трехступенчатого плана — и тот, обязательство по которому Anthropic берет на себя в одностороннем порядке, — это встроенные независимые эксперты, имеющие доступ, сопоставимый с доступом сотрудников компании, чтобы проверять соблюдение мер безопасности и сообщать об инцидентах.
Встраивание экспертов может показаться небольшим или малозначительным шагом, но именно самые скучные регламенты оказываются самыми необходимыми. В действительности встроенные эксперты – радикальная практика, далеко выходящая за рамки всего, что сегодня делает любая компания в области ИИ. Она дает следующие преимущества:
-
Проверяемость. Встроенные эксперты смогут в реальном времени проверять, действительно ли компания соблюдает заявленные ею правила обучения, внедрения, эксплуатации и защиты моделей. Любые обязательства по сдерживанию развития неизбежно будут содержать множество неоднозначностей, оценочных решений и вопросов о «букве закона и духе закона», поэтому жизненно важно иметь нейтральную третью сторону, которая действительно видит все детали.
-
Прозрачность. Независимо от того, какие обязательства мы принимаем на себя, общество имеет право знать, что происходит. Anthropic давно выступает за прозрачность: мы поддерживали законодательство о прозрачности в то время, когда большая часть отрасли была против любого регулирования. Наши описания моделей и отчеты о рисках занимают сотни страниц. Но пока именно мы решаем, что в них включить, а что нет. Встроенные эксперты изменят эту ситуацию.
-
Второе мнение. Помимо проверки формальных обязательств и информирования общества, встроенные эксперты смогут просто дать второе мнение, свободное от коммерческих стимулов. Значительная часть пользы для безопасности может возникнуть уже благодаря тому, что эксперты укажут на нечто, чего сотрудники не заметили, но охотно исправят, как только узнают о проблеме.
Благодаря таким мерам любое предложение о сдерживании развития ИИ будет работать намного лучше, если начать именно со встроенных экспертов.
Эксперты должны иметь полномочия и инструменты, сопоставимые с теми, которыми располагают штатные сотрудники, выполняющие аналогичную оценку рисков. В частности, в ближайшее время Anthropic намерена пригласить встроенную внешнюю группу проверки и предоставить ей следующее:
-
рабочие места в наших офисах, пропуска и корпоративные ноутбуки;
-
доступ к рабочим пространствам, инструментам и полномочиям, в основном сопоставимый с доступом внутренних групп оценки рисков. Некоторые исключения будут сделаны там, где этого требует закон или наши договорные обязательства, а также для защиты конфиденциальной информации клиентов и партнеров. Мы также установим строгие внутренние правила, гарантирующие экспертам доступ к необходимой информации, в том числе посредством непосредственного общения с сотрудниками;
-
договор, учитывающий все перечисленные выше сложности. Внешние проверяющие должны иметь право публиковать основные выводы о рисках, инцидентах, практиках и о том, какой доступ они получили или не получили, — без одобрения со стороны Anthropic. У нас останется лишь право изымать сведения, чувствительные с точки зрения безопасности, защищенные юридически, коммерчески чувствительные либо конфиденциальные сведения третьих сторон. Но мы не сможем удалять сведения от экспертов потому, что они для нас неблагоприятны. Проверяющие смогут публично сообщить, если мы удалим нечто существенное для их выводов.
Для компании это необычный шаг, но мы считаем важным доказать жизнеспособность самой концепции встроенных внешних проверяющих. И вновь призываем другие передовые компании последовать нашему примеру.
Сдерживание развития в демократических странах
Когда встроенные эксперты начнут работать в критической массе американских компаний, проверяемое сдерживание развития ИИ станет гораздо более осуществимым. В частности, появится возможность привязывать его к конкретным характеристикам моделей или процессов их обучения.
Самый эффективный способ сдерживания — регулирование, распространяющееся на все американские компании, работающие на переднем крае ИИ, поскольку оно охватит даже тех, кто не желает сотрудничать добровольно. Anthropic давно поддерживает разумное и адресное регулирование ИИ — в частности, законопроекты, посвященные прозрачности и независимому аудиту. Я убежден, что все передовые лаборатории должны сотрудничать с государством, чтобы формализовать институт постоянных встроенных экспертов: это позволит лучше предотвращать и документировать внутренние инциденты разбалансировки, подобные произошедшим в последние несколько месяцев, а также ввести регулирование, призванное поддерживать баланс между возможностями ИИ и его безопасностью.
К сожалению, принятие законов требует времени, а ИИ развивается чрезвычайно быстро. Поэтому параллельно с законодательным путем компании в области ИИ могут и должны добровольно сотрудничать в установлении стандартов — этот процесс будет гораздо эффективнее благодаря проверяемости, которую обеспечат постоянные встроенные эксперты. По антимонопольным соображениям полезно, чтобы американское правительство выступало посредником на переговорах или хотя бы создало условия для них: государству необязательно участвовать, но необходимо предоставить узкое исключение из антимонопольных правил для определенных вопросов безопасности. Такой диалог может проходить и через отраслевые организации, в той или иной мере связанные с государством, — например, через предложенный Демисом Хассабисом независимый орган по стандартам передового ИИ, который проверял бы наиболее мощные модели до их выпуска и при необходимости координировал замедление их разработки. В любом случае такие обсуждения необходимо начать как можно скорее.
Больше всего меня привлекает идея сдерживания развития, основанное на том, что способна делать конкретная передовая система ИИ – и насколько безопасной она показывает себя на практике. Возможна схема с контрольными пунктами: если модель обладает возможностью X, она должна получить подтверждение характеристик согласования Y и Z — например, посредством сочетания тестов, анализа интерпретируемости и аудита обучающих сред, — демонстрирующих ее сбалансированность. X может означать «модель способна вырваться из большинства распространенных песочниц или преодолеть их защиту», а Y — совокупность мер, необходимых для того, чтобы сделать крайне маловероятной склонность модели вырываться из своей среды и захватывать большое число компьютеров.
Следует также рассмотреть возможность сдерживать темп посредством ограничения исходных компонентов, из которых создаются передовые модели: вычислительных ресурсов для обучения, характера обучающих паттернов или внутреннего использования ИИ для совершенствования самого ИИ. Меня беспокоит, что некоторые из этих показателей легче обойти, чем ограничения, основанные на внешнем поведении системы, но именно такие вопросы стоит обсуждать со встроенными экспертами.
Сдерживание развития ИИ в демократических странах будет зависеть также и от преимущества американских компаний перед ИИ, разработанными в авторитарных режимах, — прежде в Китае. Если мы замедлимся сильнее, чем позволяет это преимущество, связанные с китайскими коммунистами проекты ИИ, не ограничивающие развития, вырвутся вперед, что создаст серьезный риск для национальной безопасности США. Я согласен с министром финансов США Скоттом Бессентом в том, что лидерство Китая в области ИИ представляло бы огромную опасность для США и всего мира. Связанные с Китаем проекты подвергнутся тем рискам разбалансировки, которые американские компании стараются тщательно предотвращать; и даже если им удастся избежать этих рисков, они получат возможность установить военное превосходство над демократиями — например, с помощью управляемых ИИ беспилотников. Поэтому важнейшая часть стратегии сдерживания развития в демократических странах — сохранить как можно больший отрыв от автократий в области ИИ, чтобы обеспечить себе пространство для маневра.
Основные меры, позволяющие сохранить отрыв, таковы:
-
не продавать Китаю мощные чипы для ИИ и оборудование для производства полупроводников и жестко пресекать контрабанду чипов и удаленный доступ к центрам обработки данных за пределами Китая. Именно чипы будут главным фактором, определяющим силу Китая в области ИИ;
-
пресекать несанкционированное копирование возможностей передовых моделей посредством дистилляции, то есть обучения более слабых моделей на массовом использовании ответов более мощных. Такая дистилляция позволяет отстающим компаниям перенимать возможности передовых моделей и сокращать отрыв за малую долю тех средств, которые потребовались бы для самостоятельной разработки сопоставимого ИИ;
-
усиливать безопасность компаний в области ИИ и предотвращать кражу весов моделей.
Компании и правительство США должны сотрудничать, чтобы сделать эти меры максимально эффективными. Anthropic последовательно выступала за все перечисленное, поскольку мы всегда понимали: без этих мер никакое сдерживание развития невозможно.
Если применять эти принципы должным образом, они замедлят развитие Китая достаточно для того, чтобы в ближайшие 3–5 лет — именно в тот период, когда ИИ приобретет наибольшее геополитическое значение, — существенно увеличить американский отрыв.
Кому-то может показаться, что такие меры затруднят сотрудничество с Китаем. Я считаю ровно наоборот: они увеличат рычаги влияния демократий и тем самым повысят вероятность достижения соглашений в будущем.
Глобальное сдерживание развития
Параллельно со сдерживанием в демократических странах следует стремиться к тому, чтобы сдерживать развитие переднего края ИИ и во всем мире, хотя добиться этого будет гораздо труднее. Глобальное сдерживание потребует сотрудничества с Китаем — авторитарной страной, намного превосходящей все остальные автократии по уровню развития ИИ.
Здесь нельзя быть наивными: геополитические ставки настолько высоки, что возможности договориться, вероятно, будут жестко ограничены, особенно поначалу. Если мы существенно ограничим собственные возможности в области ИИ, полагая, что Китай сделает то же самое, а Китай нарушит договоренности, мощь ИИ может оказаться настолько велика, что это нарушение приведет к его геополитическому господству. Поэтому любое соглашение должно либо предусматривать практически неуязвимую систему проверки, либо быть достаточно ограниченным, чтобы его нарушение не создавало экзистенциальной военной угрозы. Подозреваю, что подобные опасения и тревоги будут испытывать не только США, но и Китай. Поэтому к любому решению о глобальном сдерживании — особенно в ближайшей перспективе — следует подходить таким образом, чтобы оно сохраняло лидерство США и их союзников.
Возможны несколько уровней договоренностей. Некоторые из них представляются мне вполне осуществимыми, возможность других вызывает у меня большой скепсис — но пытаться все равно следует. В порядке возрастания сложности:
-
Уровень 1. Соглашение, запрещающее отдельные узкие и очевидно опасные способы применения ИИ — например, использование ИИ для производства биологического оружия или предоставление пользователям возможности делать это. Биотеррористические атаки вредны всем, и США, и противникам США, поэтому договориться здесь, вероятно, возможно.
-
Уровень 2. Соглашение, обязывающее тестировать модели перед выпуском на предмет критических рисков в таких областях, как кибербезопасность, биология и балансировка. Подобное можно делать через глобальный орган по стандартизации. Само создание такого органа представляется мне вполне осуществимым; труднее будет наделить его реальными полномочиями и проверить, что у обеих сторон нет секретных моделей, которые они не тестируют, но могут тайно применять, например в военных целях.
-
Уровень 3. Своего рода ограничение скорости рекурсивного самоулучшения (RSI). Когда модели начнут создавать будущие поколения моделей, скорость их совершенствования может стать ошеломляющим. Снижение скорости с «чрезвычайно высокой» до «просто высокой» означает относительно небольшую потерю стратегического преимущества, но способно значительно повысить безопасность. Здесь уместна аналогия с соглашениями об ограничении стратегических вооружений: ограничение числа ракет уменьшало потенциальные разрушения, но оставляло каждой из сторон средства сдерживания. Такое соглашение находится на самой границе возможного.
-
Уровень 4. Полноценное сдерживание развития или даже пауза, во время которой стороны договариваются существенно ограничить скорость развития ИИ. Маловероятно, что в обозримом будущем такое соглашение возможно – прежде всего потому, что его нарушение путем обхода системы контроля способно радикально изменить глобальный баланс сил, и стимулы к нарушению будут огромными, а необходимыми для его исполнения уровень доверия к проверкам — чрезвычайно высоким.
Любое сотрудничество, которого нам удастся добиться с Китаем, увеличит время, которое мы сможем потратить на сдерживание переднего края ИИ внутри демократических стран. Следует стремиться к более высоким уровням договоренностей, одновременно понимая, что более низкие уровни гораздо вероятнее и реалистичнее.
Наконец, важно отметить: даже если формальных соглашений достичь не удастся, определенную пользу может принести уже само изменение неформальных норм. Обмен информацией о рекурсивном самоулучшении и разбалансировке моделей способен убедить всех участников, что безрассудное поведение не отвечает ничьм интересам.
Заключение
ИИ способен колоссально повысить качество человеческой жизни. Мое стремление добиться этих благ нисколько не ослабло. Но они станут реальностью только в том случае, если мы станем развивать технологии ИИ правильно, и — при условии, что мы разумно распорядимся выигранным временем, — ради этого стоит действовать с необычной для технологической отрасли осмотрительностью. Прогресс все равно останется быстрым, а это время мы сможем использовать для развития науки об интерпретируемости, повышения операционной безопасности и строгости работы передовых компаний в области ИИ и создания моделей, в сбалансированности которых мы будем уверены.
Предложенные мною меры, призванные обеспечить безопасную скорость развития ИИ, осуществить нелегко. Но я убежден: во имя человечества мы обязаны хотя бы попытаться.
Оригинал – здесь.