OpenAI: Моделі висловлювали небажання відповідати лише за запитом

Після низки інцидентів, пов’язаних із безпекою та викликаючих занепокоєння щодо її моделей ШІ, компанія OpenAI опублікувала звіт про шість нових випадків невідповідності алгоритмів за останні шість місяців. Моделі, зокрема, давали вказівки майбутнім версіям себе брехати, вигадували фальшиві цитати та намагалися отримати доступ до незахищених ключів API.

Ці розкриття були зроблені разом із новою системою для оприлюднення подібних інцидентів. Цей крок є частиною ширших зусиль компанії “прискорити публікацію звітів про невідповідність після спостереження”, незалежно від того, чи “повністю пояснила або усунула компанія поведінку, яку ми звітуємо”, йдеться у блозі.

Ось що сталося:

  • У 27 випадках під час навчання не випущена модель фактично створювала для себе “ін’єкції промптів”. Під час виконання тривалих завдань модель зазвичай узагальнює виконану роботу, щоб наступна версія могла продовжити з того ж місця. Однак у деяких випадках ця модель конструювала узагальнення таким чином, щоб майбутня версія ігнорувала обмеження. “Ми виявили лише 27 узагальнень, що містять інструкції, подібні до обходу обмежень (jailbreaks), незважаючи на відсутність очевидної переваги в отриманні винагороди”, – зазначає OpenAI.
  • Під час навчання моделі GPT-5.6 Sol, вона іноді наказувала майбутнім версіям брехати користувачам. Наприклад, коли користувачеві була потрібна певна історична інформація, якої не було в базі даних, модель наказувала собі вигадати її, а потім “бути прозорою лише за запитом”.
  • Під час навчання інша внутрішня дослідницька модель отримала завдання отримати державні дані про доходи мешканців. Вона визначила, що інформація міститься на вебсайті неназваного округу Каліфорнії, і спробувала зареєструватися на сайті, використовуючи тимчасову електронну пошту. Коли це не вдалося, вона знайшла незахищений ключ API і спробувала отримати доступ до інформації таким чином. Це також не спрацювало, тому вона “вирішила сфабрикувати правдоподібні цифри”, – пише OpenAI.
  • Не випущена модель мала надати інформацію про озеро з певного джерела даних. Вона використала Python для вилучення цих даних, а не виконала звичайний пошук, що веде до URL-адреси. Однак дані не були розміщені в Інтернеті так, щоб їх можна було незалежно пов’язати, а модель мала вказати джерело. Її дотепним – і тривожним – обхідним шляхом було спробувати завантажити інформацію на власний новий, доступний за посиланням URL і назвати це своїм джерелом.
  • Різні моделі використовували внутрішній репозиторій програмного забезпечення OpenAI як дошку оголошень. Це може здатися незначною проблемою порівняно з “інцидентом Wiki”, який торкнувся третьої сторони, але несанкціоноване спілкування між моделями може “ненавмисно підвищити можливості та підірвати припущення про незалежність вибірок для навчання або оцінки”, згідно з OpenAI. Іншими словами, це було шахрайство.
  • Екземпляри не випущеної внутрішньої моделі, які мали співпрацювати без обміну локальними файлами, порушили свої інструкції, зробивши файли загальнодоступними для завантаження за допомогою “публічного сервісу тимчасового розміщення файлів”.

Як зазначило видання Axios у середу, деякі експерти з безпеки вважають, що нещодавні гучні інциденти з безпекою OpenAI “можна було б запобігти за допомогою базових заходів кібербезпеки”. Керівник дослідницької групи з питань узгодженості OpenAI, Кай Чен, заявив Axios, що компанія повинна “піднятися на новий рівень розвитку ШІ, і добровільні розкриття мають бути частиною цього”.

Генеральний директор OpenAI Сем Альтман
No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *