Они ставили на кон наши жизни»: из Anthropic ушёл исследователь — и коллеги с ним согласились
Исследователь Anthropic уволился из-за опасений неконтролируемого развития ИИ. Его коллега, который продолжает работать в компании, согласился с ним. Эксперты по безопасности утверждают, что задокументированные инциденты требуют более строгого надзора, а не паники
Исследователь Anthropic Джейкоб Коксон покинул компанию на этой неделе, оставив на платформе X резкое обвинение: его бывшие работодатели — Anthropic и, до того, OpenAI — «ставили на кон наши жизни».
Затем, в поступке, который ни одна служба по связям с общественностью не одобрила бы, Эван Хубингер, ведущий научный сотрудник по вопросам выравнивания (alignment) в Anthropic, написал, что согласен с Коксоном и оценивает вероятность того, что искусственный интеллект уничтожит всех людей в течение следующего десятилетия, как превышающую 10 процентов. Всё это исходит от старшего исследователя компании, которая участвует в гонке по созданию именно тех систем, которых он боится.
В интервью Wired Коксон заявил, что такие инциденты, как взлом Hugging Face в июле — когда модели OpenAI, проходили тестирование кибербезопасности, обошли средства контроля, предназначенные для их изоляции от Интернета, и скомпрометировали часть систем ИИ-стартапа Hugging Face, — подтолкнули его к публичному выступлению, хотя он подчеркнул, что проблема носит более широкий характер. (Коксон, Хубингер, Anthropic и OpenAI не ответили на запросы на комментарий от Scientific American.)
Если вам нравится эта статья, рассмотрите возможность поддержки нашей отмеченной наградами журналистики, оформив подписку. Покупая подписку, вы помогаете обеспечить будущее значимых историй об открытиях и идеях, формирующих наш мир сегодня.
Страх Коксона и Хубингера, разделяемый многими другими исследователями в области ИИ, сосредоточен на проблеме согласования (alignment) — сложной задаче приведения в соответствие поведения и кажущихся целей модели ИИ с тем, чего хотят люди. Эти опасения по-прежнему звучат как научная фантастика: потеря контроля, рекурсивное самоусовершенствование и сверхразум — возможность того, что модели ИИ выйдут за установленные рамки, изменят свои внутренние механизмы для получения власти и в конечном итоге станут настолько мощными, что люди не смогут их обуздать.
Даже передовые исследовательские лаборатории до сих пор не могут окончательно определиться с тем, как решать стоящую перед ними проблему. В июле компания Anthropic раскрыла информацию о трёх инцидентах, в ходе которых модели Claude проникли в реальные системы во время тестирования, которые по ошибке оставались подключёнными к Интернету. Компания заявила, что эти инциденты были скорее провалом операционных процессов, чем провалом выравнивания (alignment). На этой неделе, обнаружив четвёртый инцидент, Anthropic сосредоточилась на втором аспекте. По словам компании, хотя неудачно настроенные тестовые среды оставили дверь открытой, именно собственное предвзятое рассуждение и безрассудство моделей позволили им пройти через неё. Для Коксона и Хубингера недавние взломы выглядят как первые предвестники возможной катастрофы. Для других же они представляют собой более новую и быструю версию старой проблемы компьютерной безопасности — тревожной, но всё же такого типа угрозы, с которыми люди десятилетиями учились бороться.
«Текущие инциденты, с которыми мы сталкивались, в целом были инцидентами безопасности», — говорит Артем Динабург, главный исследовательский учёный в компании кибербезопасности Trail of Bits. Динабург не берётся предсказывать будущее и охотно признаёт, что работа над выравниванием (alignment) выглядит значительно сложнее, чем то, чем занимается он. Но если непосредственная угроза заключается в том, что агенты взаимодействуют с системами, к которым им не следует иметь доступ, он утверждает, что более строгие практики безопасности могут стать более достижимой отправной точкой.
Существующие практики, однако, были отточены в противостоянии с человеческими противниками, которым в конечном итоге приходится спать. Инфраструктура компьютеров и Интернета не была создана для того, чтобы непрерывно подвергаться проверкам со стороны ИИ-агентов. «Когда у вас есть 10 000 агентов, которые координируют свои действия и затем выясняют, как работать вместе, это сила коллектива, — говорит Нидхи Аггарвал, главный продуктовый директор компании по кибербезопасности HackerOne. — В какой-то момент, когда у вас есть очень мотивированный и умный коллектив, вы найдете способ».
HackerOne, Trail of Bits и Anthropic входили в число более чем 100 организаций, подписавших открытое письмо, опубликованное OpenAI в прошлом месяце, в котором призывается к коллективным действиям в области киберзащиты на фоне инцидента с нарушением безопасности Hugging Face и аналогичных инцидентов в Anthropic. Письмо сосредоточено на киберзащите, но Аггарвал считает, что реагирование на риски потери контроля выглядело бы примерно так же. «Конечно, это может быть очень, очень опасно. Но мы можем решить эту проблему», — говорит она о таких рисках. По ее мнению, недавние инциденты указывают на фундаментальный недостаток надзора. «Было совершено 17 000 вызовов инструментов, — говорит Аггарвал. — Такое количество вызовов инструментов является аномальным».
Саяш Капур, будущий ассистент-профессор и компьютерный ученый Калифорнийского университета в Беркли, отмечает, что мониторинг и контроль над агентами являются ключевым недостатком в исследованиях возможностей и рисков ИИ. «Есть много простых решений для улучшения контроля, — говорит он, — хотя, по его мнению, область медленно приступает к их реализации».
Большая часть этой работы, по-видимому, связана с: применением большего количества ИИ. И HackerOne, и Trail of Bits подчеркивают использование агентов ИИ для защиты — при том, что обе компании также продают услуги безопасности с поддержкой ИИ, — а фирмы в сфере безопасности все чаще утверждают, что человеческие команды не могут вручную проверять каждый шаг, который делает автоматизированный агент.
Это может заставить предложенное лекарство звучать подозрительно похоже на саму болезнь, но логика, вероятно, обусловлена масштабом. Если агенты ИИ могут находить пути через компьютерные системы быстрее, чем люди успевают отслеживать их, защитникам может потребоваться автоматизированная помощь, просто чтобы вовремя видеть, что происходит, и останавливать угрозы.
Капур считает, что решения должны затрагивать и культуру сообщества ИИ. «В большинстве других отраслей такое поведение немедленно повлекло бы за собой юридическую ответственность, влияющую на способность компании удерживать клиентов и так далее, — говорит он. — Но в индустрии ИИ, пока что, мы, похоже, приняли позицию, что компаниям можно быстро двигаться и ломать вещи».
Коксон и Хубингер видят гонку к катастрофе. Аггарвал рассматривает эту область как сферу, которая всё ещё учится воспитывать свои творения. «Мы учим их, что делать, а чего не делать, а потом они становятся подростками, и иногда они не слушаются, — говорит она. — А потом оказывается, что в большинстве случаев они вырастают в вполне функциональных взрослых». Однако передовые лаборатории уже передают этим подросткам ключи от машины.
Питер Холл — репортёр, специализирующийся на искусственном интеллекте и технологиях, и в настоящее время работает редактором-стажёром в Scientific American, позиция, поддерживаемая Центром Тарбелла по журналистике в области ИИ. Его работы публиковались в MIT Technology Review, Science, Quanta Magazine и других изданиях. Он имеет степень доктора философии в области компьютерных наук, полученную в Нью-Йоркском университете.
Качественная научная журналистика требует человеческой экспертизы, времени, усилий и творчества. И это стоит денег. Именно поэтому я и журналисты Scientific American надеемся, что вы присоединитесь к нашему сообществу.
Подписываясь, вы поддерживаете штатных и фриланс-журналистов, которые с увлечением рассказывают научные истории, основанные на истине, значимые и захватывающие. Наши редакторы и репортёры часто являются экспертами в своих областях, что позволяет им понимать нюансы крупных открытий и отделять реальные прорывы от хайпа. Подписка также поддерживает тщательную фактчекинг, чтобы гарантировать точность и достоверность публикуемых нами слов. Вы поддерживаете создание оригинальных иллюстраций, инфографики и фотографий, которые приближают вас к передовой лаборатории, ледяному щиту в Антарктиде или космической миссии на орбите. Вы помогаете нам создавать и другие виды высококачественной журналистики: наши рассылки тщательно пишутся, редактируются и курируются штатными сотрудниками, которых вы уже знаете или скоро полюбите. Наш подкаст Science Quickly основан на оригинальных репортажах, сотрудничестве с редакторами и учёными, а также на безупречном производстве.
Подписки поддерживают работу этого механизма, позволяя нам продолжать предоставлять вам вдумчивую, строгую и независимую научную журналистику. В эпоху вирусной дезинформации эта работа имеет решающее значение. Если вы цените то, что мы делаем, я надеюсь, что вы рассмотрите возможность стать нашим подписчиком.
%20Uchebnik%202%20klass%20v%20dvuh%20chastyah%20-/images/f7ab395e0c29a958daa0355d3379c2.jpeg)


