
Глава Anthropic Дарио Амодеи предложил замедлить развитие мощных ИИ-моделей. Узнайте, почему рекурсивное самосовершенствование нейросетей требует новых мер безопасности.
Глава компании Anthropic Дарио Амодеи выступил с программным заявлением, в котором призвал технологическую индустрию намеренно замедлить темпы разработки наиболее мощных моделей искусственного интеллекта. По мнению руководителя одного из главных конкурентов OpenAI, текущая скорость прогресса опережает возможности человечества по обеспечению безопасности и контролю над системами, что создает беспрецедентные риски.
Основным аргументом Амодеи в пользу регулирования темпов разработки стало явление, которое в индустрии называют рекурсивным самоулучшением. Современные нейросети уже достигли того уровня, когда их можно использовать для написания кода, оптимизации архитектур и подготовки данных для обучения следующего, еще более мощного поколения ИИ. В последние месяцы этот цикл значительно ускорился.
Дарио Амодеи подчеркивает, что такая автономия в развитии может привести к моменту, когда изменения в возможностях моделей будут происходить быстрее, чем исследователи успеют их осознать и внедрить соответствующие механизмы защиты. Призыв к паузе или «соразмерному темпу» (pacing) направлен не на прекращение исследований как таковых, а на то, чтобы дать специалистам по безопасности временное окно для адаптации инструментов контроля.
Для предотвращения выхода ситуации из-под контроля глава Anthropic предложил структурированный подход к надзору, состоящий из трех последовательных этапов:
Anthropic уже начала внедрять эти принципы на практике. Компания планирует предоставить внешним аудиторам доступ к своим ресурсам на уровне штатных сотрудников. Проверяющие смогут посещать офисы, использовать рабочие инструменты и изучать внутренние протоколы оценки рисков. Важным условием является право аудиторов публично сообщать о выявленных проблемах, что обеспечивает прозрачность процесса разработки моделей линейки Claude и других будущих систем.
По оценке Амодеи, получение даже одного или двух дополнительных лет перед выпуском следующего поколения критически мощных моделей может иметь решающее значение. Это время необходимо потратить на решение фундаментальных проблем интерпретируемости — понимания того, как именно нейросеть принимает решения на внутреннем уровне.
В настоящий момент развитие функционала ИИ (его способности решать задачи) идет намного быстрее, чем развитие методов верификации и тестирования. Если этот разрыв продолжит расти, системы могут стать «черными ящиками», поведение которых невозможно предсказать в критических ситуациях. Дополнительное время позволит создать более надежные архитектуры, которые будут устойчивы к манипуляциям и защищены от использования в злонамеренных целях. Таким образом, замедление темпов становится не препятствием для прогресса, а необходимым условием для его долгосрочной устойчивости и безопасности для общества.
Ежедневные подборки промптов, свежие новости и материалы об ИИ — там, где удобно. Без спама, только редакционный отбор.