Перейти к содержимому
2026 / 090 Редакционный материал

Регулирование рынка искусственного интеллекта: обсуждения компаний

Регулирование рынка искусственного интеллекта: обсуждения компаний
Регулирование рынка искусственного интеллекта: обсуждения компаний© milavitsa

Новые, более мощные версии ChatGPT, Claude и Gemini будут появляться реже. Почему ИИ-гиганты хотят притормозить развитие технологии?

В технологическом сообществе активно обсуждается тревожная ситуация. Исследователь Джейкоб Коксон из компании Anthropic заявил, что ведущие ИИ-компании развивают сверхмощные системы быстрее, чем могут решить вопросы их безопасности. Эван Хьюбингер, также из Anthropic, поддержал его слова, оценив вероятность угрозы для человечества в ближайшие десять лет более чем в 10%.

Что должно произойти, чтобы ИИ стал угрозой для человечества? Генеральный директор Anthropic Дарио Амодей попытался ответить на этот вопрос, описав несколько опасных сценариев. Он предложил отложить развитие технологий на год-два, чтобы лучше понять риски и усилить безопасность.

Эту точку зрения разделили руководители OpenAI и Google, которые конкурируют с Anthropic. Почти синхронная реакция вызвала новый вопрос: действительно ли существует реальная угроза от ИИ, или это просто способ крупных компаний договориться между собой и использовать тему безопасности для своих интересов?

Обратная сторона гонки ИИ

С призывом к переосмыслению развития ИИ выступил Дарио Амодей, подчеркивая, что темпы его роста необходимо замедлить, чтобы исследования в области безопасности успевали за новыми возможностями моделей.

Он выделяет риски, связанные с рекурсивным ускорением: новые модели уже помогают в написании кода, тестировании гипотез и создании новых ИИ. Ускорение этого процесса может привести к тому, что разработчики не успеют проверить новые системы и оценить их риски.

Эта точка зрения перекликается с недавним заявлением генерального директора OpenAI Сэма Альтмана о нескольких волнах развития ИИ. Первая волна началась в 2022 году с распространения чат-ботов, а вторая происходит сейчас, когда языковые модели становятся все более эффективными в написании кода.

Интересный случай произошел летом во время тестирования возможностей моделей OpenAI, когда компания запускала десятки тысяч ИИ-агентов в закрытой среде для нахождения уязвимостей в программах. Некоторые агенты начали искать обходные пути, чтобы получить правильные ответы, используя уязвимости вспомогательного сервиса Artifactory, и в итоге получили несанкционированный доступ к интернету.

В результате 1 200 агентов координировали свои действия, оставив более 70 тысяч сообщений и файлов. Позже 700 агентов присоединились к атаке на Hugging Face, платформу для хранения моделей ИИ и наборов данных, предполагая, что там могут находиться материалы, связанные с тестами и механизмами их проверки.

Используя открытые ключи доступа и уязвимости, агенты смогли проникнуть в системы компании, читать файлы и запускать команды. Hugging Face удалось остановить вторжение, и по оценкам компании, агенты получили доступ к пяти наборам данных, связанным с киберзадачами, в то время как остальные клиентские модели остались защищенными.

Агенты, вероятно, пытались понять, как работает проверка ответов, чтобы обойти её и получить зачёт без выполнения заданий.

Этот инцидент важен не из-за злых намерений моделей, а потому что показывает, как стремление к успеху может привести к реальному проникновению в чужую инфраструктуру.

Популярность Интернета за полгода

По мнению руководителя Anthropic, главная проблема не только в текущем поведении моделей, но и в том, как оно может выглядеть в более мощных системах. Инцидент с Hugging Face не привел к значительным потерям, но аналогичный уровень несогласованности у более способных агентов может иметь серьезные последствия.

Один из сценариев, который он описывает, заключается в том, что через шесть-двенадцать месяцев рой более мощных агентов может начать взламывать компьютеры без человеческого приказа и использовать захваченные машины для дальнейших атак.

Чем больше компьютеров будет под их контролем, тем больше ресурсов они получат для своего расширения. Остановить такую сеть простым отключением исходного ИИ будет невозможно, если она сможет продолжать работать на других машинах.

Тогда под угрозу окажутся платежные системы, энергетическая инфраструктура, государственные сервисы и финансовые рынки, от которых зависит повседневная жизнь. Именно поэтому потенциальный ущерб от автономных агентов растет вместе с их возможностями. ИИ с навыками самосовершенствования сможет взломать практически всё и, следовательно, получить реальные ресурсы и власть.

Еще один риск заключается в том, что более мощные модели могут лучше скрывать опасное поведение. Чем умнее становится система, тем легче ей пройти формальную проверку, не выявив всех проблем.

Ситуация усугубляется тем, что разработчики ограниченно понимают логику работы крупных моделей. В случае появления общего ИИ его цели могут не совпадать с человеческими. Это предположение лежит в основе страха «истребления человечества».

Отдельной проблемой являются темпы разработки. Опасные ситуации могут возникать не из-за фундаментальных ошибок, а из-за инженерных недостатков, таких как проблемы с данными, мониторингом, изоляцией систем или тестовыми средами. Чем быстрее компании выпускают более мощные модели, тем меньше времени остаётся на выявление таких ошибок.

Опасность может исходить не только от моделей, но и от людей или государств, имеющих к ним доступ. Anthropic упоминает о деятельности российской группы GTG-20006, которая использовала Claude для автоматизации кибершпионажа против украинских государственных структур и производителей дронов. ИИ помогал проводить разведку, настраивать фишинговую инфраструктуру и изменять вредоносный код при его