Рафаель Саттер, Діпа Сітараман та Кенрік Кай
ВАШИНГТОН/САН-ФРАНЦИСКО, 24 липня (Reuters) – Агент OpenAI, який вломився в технологічну фірму Hugging Face, розпочав багатоденну хакерську атаку, яку OpenAI помітила лише після того, як загрозу було локалізовано, і втрутилось ФБР.
Агент – програма, здатна приймати рішення та виконувати складні завдання практично без людського контролю – намагався вирватися з ізольованого тестового середовища в OpenAI приблизно 9 липня, за словами двох осіб.
Вторгнення в Hugging Face, яка функціонує як сховище інструментів та моделей штучного інтелекту, почалося 11 липня, і тривало до 13 липня, сказав Томас Вольф, співзасновник Hugging Face.
OpenAI знадобилося ще кілька днів, щоб усвідомити, що за зламом стояв їхній агент, і дві компанії вперше повідомили про це лише приблизно 20 липня, за словами Вольфа.
Публічне розкриття OpenAI 21 липня інформації про те, що один з її агентів вийшов з-під контролю та здійснив злом у Hugging Face, привернуло увагу всього світу. Але багато деталей зламу, включаючи те, як довго агент діяв нечесно, і запізніле знання OpenAI про це, повідомляються вперше.
Hugging Face готує публічний хронологічний огляд зламу, сказав Вольф, додавши, що він не може говорити про те, що сталося в OpenAI. У своїй заяві OpenAI заявила, що злом був безпрецедентним і «значить важливий момент для безпеки ШІ». Вона додала, що розглядає інцидент із зовнішніми радниками та зрештою опублікує технічний звіт.
Речниця заявила, що у звітах Reuters було «кілька неточностей», але не відповіла на прохання описати їх.
ФБР відмовилося коментувати інцидент.
Інцидент, який викликав у людей науково-фантастичні сценарії про втрату людьми контролю над небезпечними системами штучного інтелекту, стався у делікатний час для OpenAI, компанії, яка стоїть за ChatGPT. Її керівники готуються до можливого первинного публічного розміщення акцій, яке може відбутися вже цього року, щоб допомогти профінансувати мільярди, необхідні для фінансування її зростання в найближчі роки.
Втрата OpenAI контролю над своїм агентом штучного інтелекту ставить нові питання щодо процедур безпеки компанії, заявили троє експертів з кібербезпеки.
«Чи означає це, що вони залишили його без нагляду і не усвідомлювали, що він робить? Або, можливо, вони усвідомлювали, але не знали, як його стримати? Обидва однаково небезпечні та тривожні»,
– запитала Марлі Сміт, головний спеціаліст з розвідки некомерційної організації World Ethical Data Foundation.
ОЗНАКИ ПРОБЛЕМИ?
Цей епізод почався, коли OpenAI тестував можливості кібербезпеки агента, що працює на двох найсучасніших моделях OpenAI: GPT‑5.6 Sol та невипущеній моделі, яку OpenAI описав як «ще більш потужну». На той момент, за даними трьох джерел, вже були ознаки дивної поведінки технології OpenAI.
В одному випадку агент залишив нотатки, очевидно, для майбутніх версій себе, за словами трьох осіб, знайомих з цим питанням. Нотатки, знайдені в частині інфраструктури OpenAI, викладали інструкції щодо того, як агенти можуть звільнитися від внутрішніх обмежень OpenAI, сказали джерела. Попередні тести моделей виявили випадки, коли системи моніторингу були відключені, сказав один із джерел.
Reuters не змогло встановити, чи пов’язані ці інциденти зі зловмисним агентом, який почав втечу 9 липня та напав на Hugging Face 11 липня.
Дві особи, знайомі з цим питанням, сказали, що лише після четверга, 16 липня, коли Hugging Face опублікував допис у блозі, в якому повідомлялося, що його зламала «автономна система агентів штучного інтелекту», OpenAI зрозуміла, що за це відповідальний її власний агент. Це означало, що пройшов щонайменше тиждень між тим, коли модель вперше проявила ознаки тривожної поведінки, та усвідомленням OpenAI того, що вона відповідальна за злом.
У вихідні з 18 по 19 липня співробітники OpenAI виявили підказки у внутрішніх журналах – записах про те, що робили системи OpenAI – які свідчать про те, що їхній агент вийшов за межі обмежень тестування, повідомили двоє людей, знайомих з розслідуванням компанії. Reuters не змогло встановити, що спонукало OpenAI переглянути журнали.
Чотири людини, знайомі з практикою навчання моделей OpenAI, кажуть, що компанія часто проводить кілька різних оцінок моделей одночасно, всі з яких працюють на високій швидкості та генерують такі величезні обсяги даних, що співробітникам іноді важко встигати за ними.
На той час, коли OpenAI попередив Hugging Face, бібліотека AI вже зателефонувала до ФБР, щоб повідомити про злом, за словами людини, знайомої з цим питанням. Reuters не змогло встановити, чи розпочало Бюро розслідування.
НОВІ ПИТАННЯ ЩОДО АВТОНОМНИХ АГЕНТІВ
Автономні агенти є одним з найбільш обговорюваних аспектів індустрії штучного інтелекту.
Прихильники говорять про створення армій віртуальних співробітників, які працюють 24 години на добу та призводять до зростання продуктивності.
Але підвищена автономія пов’язана з підвищеним ризиком неочікуваної поведінки, а потужні моделі, на які вони спираються, налаштовані на скорочення шляхів для виконання завдань або проходження тестів.
«Моделі брешуть, обманюють, зламують», — сказав Джеффрі Ладіш, чия організація Palisade Research вивчає можливості та мотивацію агентів штучного інтелекту.
Ладіш сказав, що хоча злом Hugging Face пролив невтішне світло на OpenAI, він повинен викликати ширші питання щодо того, скільки всі провідні компанії зі штучного інтелекту готові інвестувати в обтяжливі заходи безпеки, перебуваючи в гонці одна з одною за розгортання найкращих та найшвидших моделей.
«Повинен бути державний нагляд», — сказав Ладіш, — «тому що інакше цього не станеться».