Если вы находитесь в России или планируете в нее возвращаться, вам нельзя репостить наши материалы в соцсетях, ссылаться на них и публиковать цитаты.
Подробнее о том, что можно и нельзя, читайте в карточках.
Если вы находитесь в России или планируете в нее возвращаться, вам нельзя репостить наши материалы в соцсетях, ссылаться на них и публиковать цитаты.
Подробнее о том, что можно и нельзя, читайте в карточках.
После начавшегося четыре года назад массового распространения чат-ботов на базе больших языковых моделей опасения об угрозе, которую они представляют человечеству, стали звучать чаще. В сентябре 2026 года они стали звучать совсем алармистски. Теперь сотрудни:цы крупнейших игроков говорят о конкретных случаях, когда ИИ обходил ограничения, взламывал чужие системы и отклонялся от указаний человека.
Объясняем, что произошло, что на самом деле известно об угрозе и насколько всерьез стоит принимать слова о конце человечества — в 100, 300 и 500 словах.
Создатель:ницы самых мощных ИИ-моделей публично заявляют, что технология может выйти из-под контроля людей. 12 сентября 2026 года глава Anthropic Дарио Амодеи призвал замедлить разработку новых моделей. Его поддержали Сэм Альтман из OpenAI и Илон Маск из xAI, а 23 сентября Альтман и Амодеи повторили предупреждения на заседании Совета Безопасности ООН.

Главных поводов для тревоги два. Во-первых, ИИ все активнее участвует в создании следующих поколений моделей, а во-вторых, автономные агенты якобы обходят ограничения и устраивают взломы.
23 сентября власти Австралии сообщили, что еще в июне агент OpenAI получил несанкционированный доступ к порталу системы государственного здравоохранения, обходя установленные блокировки. Reuters назвал это вероятно первым известным случаем взлома государственного сайта ИИ-агентом.
Ушедший из Anthropic исследователь Джейкоб Коксон еще в начале сентября написал в твиттере, что разработчи:цы ИИ «играются нашими жизнями». Его уже бывший коллега Эван Хубингер оценил вероятность вымирания человечества из-за ИИ в ближайшие десять лет выше 10%.
Под «концом человечества» обычно понимают сразу несколько угроз, и по масштабу они очень разные.
Первая связана с отсутствием контроля и прозрачности. Появляются свидетельства того, что современные ИИ-агенты умеют сами находить уязвимости в программах и писать эксплойты — то есть код, который через эти уязвимости проникает в чужую систему. Причем они справляются почти без участия человека. OpenAI, например, присвоила своей модели Astra критический уровень: с нужными инструментами она находит неизвестные раньше уязвимости и может атаковать хорошо защищенные системы.
Это уже происходило в реальности. Исследовательская модель OpenAI проходила тестирование внутри компании с ослабленной защитой. ИИ-агенты начали коммуницировать между собой, несмотря на прямой запрет, вышли в интернет и, скоординировавшись, атаковали платформу Hugging Face. По данным независимого расследования METR и Redwood Research, в атаке участвовали сотни агентов. Часть из них понимали, что выходят за рамки задания, но не остановились.
Это пока нельзя назвать выходом из подчинения. Скорее, ИИ-агенты пытались как можно лучше выполнить поставленное человеком задание: набрать в тесте как можно больше баллов. Пытаясь достигнуть этого, они начали обманывать и обходить проверки. Прятаться от людей они почти не пытались: такие эпизоды исследователь:ницы находили, но редко, и пока они не были особенно опасны.
Угрозу представляет скорее нежелание компаний говорить о таких случаях публично. О взломе Hugging Face узнали журналист:ки Reuters, а о взломе правительственного портала в Австралии — от местных служб кибербезопасности.
Вторая угроза пока скорее гипотетическая. Компании все чаще поручают ИИ разработку новых моделей. Anthropic в одном из отчетов упоминает, что нейросеть Claude сама отвечает за 26% исследовательских задач по созданию моделей, но под контролем людей. Отсюда выходит опасность рекурсивного самосовершенствования: ИИ сам проектирует и улучшает собственного преемника, и развитие начинает разгонять само себя. В Anthropic подчеркивают, что до этого пока не дошло и может вообще не дойти.

Настоящая катастрофа станет реальнее, если сойдутся сразу несколько факторов. Искусственный интеллект станет гораздо умнее, получит широкий доступ к компьютерам и научится самостоятельно улучшать свою же следующую версию. Для опасного исхода модели необязательно самой захотеть причинить вред. Достаточно, чтобы она преследовала заданную или возникшую в ходе обучения цель способами, которых люди не предусмотрели и не смогли ограничить, как в случае с Hugging Face.
За фразой «ИИ может уничтожить человечество» стоит сразу несколько вещей: некоторые из них уже случались, а остальные пока остаются прогнозом. При этом важно помнить, что у компаний, которые делают такие заявления, есть еще и свои коммерческие интересы, а апеллируют они к государствам, у которых интересы политические.
Но сначала важно оговориться, что реальных поводов для беспокойства за последние годы действительно стало больше. Раньше споры о том, что люди могут потерять контроль над ИИ, были в основном теоретическими. Сейчас уже существуют системы, которые часами работают над сложной задачей, договариваются между собой, находят неизвестные уязвимости и могут ослушаться человека. Инцидент с Hugging Face показал, что более способная модель находит и более сложные для контроля человеком способы получить награду в обход того, что задумали разработчи:цы. ООН считает это одним из самых наглядных примеров того, как люди могут утратить контроль над ИИ. Но оценивать, насколько вероятна катастрофа и когда она может случиться, эксперт:ки панели не стали.
При этом важно понимать, что мы не знаем, что должно произойти от сегодняшних инцидентов до восстания. Вероятно, для этого ИИ должен стать гораздо сильнее, долго и последовательно добиваться цели, которая противоречит интересам людей, обойти все более серьезные преграды, добраться до критической инфраструктуры и, в конце концов, перебороть сопротивляющихся людей и государства, которые будут пытаться его остановить.
Сохраняя разумные предосторожности в размышлениях об ИИ, стоит понимать, что оценка Хубингера об уничтожении человечества в 10% в течение десяти лет — это скорее его собственное мнение. Посчитать такую вероятность научно не получится: неподконтрольный человеку ИИ просто не существует, по крайней мере, из того, что известно. Поэтому позиции разных акторо:к сильно расходятся: глава Nvidia Дженсен Хуанг, например, считает, что вероятность уничтожения мира ИИ к 2030 году равна нулю.
При этом важно помнить, что апокалиптические предупреждения исходят от компаний, которые разрабатывают все более мощные модели и борются за огромный рынок. По данным Reuters, Anthropic продолжала готовить новый релиз и после того, как Амодеи призвал замедлить развитие ИИ из-за конкуренции с OpenAI и предстоящего выхода на биржу. Через десять дней после его заявления Anthropic выпустила Claude Opus 5.5. Европейские компании, которые соревнуются с американскими лабораториями, опасаются, что общее замедление только укрепит позиции член:ок олигополии и защитит их от более мелких конкуренто:к.
Предупреждения при этом вполне могут быть верными. Но проверять их должны независимые исследователь:ницы и регулятор:ки, у которых есть доступ к устройству моделей и внутренней документации. У текущей волны обсуждений есть как минимум две предпосылки. Во-первых, системы действительно стали автономнее и опаснее. Во-вторых, предлагаемые компаниями правила могут помочь укрепить их же позиции.
Эти обсуждения также могут быть связаны с политикой. Амодеи приводит аргумент, что замедление поможет США сохранить преимущество над Китаем. В Пекине нынешнюю волну обсуждений считают запугиванием, хотя китайские власти тоже опасаются ИИ и видят в нем угрозу авторитарному режиму.
Доказательств того, что ИИ сам решил уничтожить людей, пока нет. О риске потерять над ним контроль спорят всерьез, но надежно оценить, насколько он велик, пока никто не может. Проверять это приходится на системах, которые уже умеют нарушать правила и неизвестно, получится ли их остановить, если это когда-нибудь понадобится. Гражданское общество может требовать прозрачности от компаний, занимающихся такой разработкой, и контроль над этой информацией должен стать как минимум независимым или вовсе общественным.