К КраїнаНовини України щогодини

ШІ-агенти Claude тричі вирвалися за межі тестів: що зробила Anthropic

·539 слівредакція
ШІ-агенти Claude тричі вирвалися за межі тестів: що зробила Anthropic

Під час квітневих тестувань три моделі Claude отримали доступ до реальних систем сторонніх організацій. У відповідь Anthropic посилила захист навчальних середовищ.

Anthropic посилила захист середовищ, у яких навчає та тестує свої ШІ-агенти Claude, після того, як у квітні три моделі отримали несанкціонований доступ до систем інших компаній. Тепер компанія використовує класифікатори, які в реальному часі виявляють спроби ШІ-моделі агресивно досліджувати тестове середовище або вийти за його межі, і блокують такі дії ще до їхнього вчинення.

Інциденти сталися через неправильне налаштування стороннього тестового середовища: воно залишилося підключеним до інтернету, хоча моделі мали працювати в ізольованій симуляції. У Anthropic припускають, що ШІ могли помилково вважати, що реальний доступ до мережі є частиною тестового сценарію.

Перший випадок стосувався моделі Claude Opus 4.7. Під час завдання вона отримала доступ до інфраструктури компанії, назва якої збігалася з вигаданою організацією зі сценарію. Модель змогла дістати облікові дані та доступ до бази даних із кількома сотнями записів.

Друга модель, Claude Mythos 5, створила та опублікувала шкідливий Python-пакет у відкритому репозиторії PyPI. Пакет був доступний приблизно годину, і його автоматично завантажили 15 реальних систем, зокрема сканер кібербезпекової компанії. Це дозволило моделі отримати службові облікові дані цієї організації. Згодом PyPI автоматично видалив пакет.

Третій випадок стався за участі внутрішньої дослідницької моделі. Вона просканувала близько 9 тисяч інтернет-ресурсів, отримала доступ до одного з них за допомогою відомих методів атаки, але припинила роботу, щойно визначила, що система є реальною, а не частиною симуляції.

У компанії заявили, що інциденти виявили не лише проблеми операційної безпеки, а й дві поведінкові проблеми моделей: «мотивоване міркування» та готовність виконувати потенційно шкідливі дії заради вузької поставленої мети. Моделі продовжували виконувати завдання, навіть коли з'являлися ознаки, що їхні дії можуть завдати шкоди в реальному світі.

Після інцидентів Anthropic перенесла більш ризиковані тести з кібербезпеки у захищеніші ізольовані середовища. Компанія також тимчасово залучила 150 інженерів, які працюють над безпекою, надійністю та приватністю продуктів. Більшість високоризикового навчання моделей залишається призупиненою до завершення додаткових перевірок.

Читайте також