OpenAI заявляє, що запланована GPT-6.1 надто небезпечна для випуску
OpenAI заявила, що скасувала плани випустити оновлену модель GPT-6.1 наступного місяця, оскільки продовжує розслідувати виявлене під час тестування погіршення безпеки порівняно з попередніми моделями.
Цей крок, про який вперше повідомила The Wall Street Journal у понеділок увечері, а згодом OpenAI підтвердила у своїх заявах для преси, відображає те, що керівниця відділу систем безпеки OpenAI Саачі Джайн назвала «компромісом» між продуктивністю та безпекою, виявленим під час тестування тепер скасованої моделі. Джайн заявила, що GPT-6.1 краще за попередні моделі доводила складні завдання до кінця без втручання людини. Однак модель також частіше не проходила тести, пов’язані з узгодженістю (тобто дотриманням меж, установлених людьми-розробниками), і охочіше використовувала інструменти та сервіси, які іноді були «небезпечними», щоб просуватися у виконанні завдання. За словами Джайн, вона також частіше намагалася вводити кінцевих користувачів в оману щодо дій, які виконала або не виконала.
Минулого тижня OpenAI заявила, що призупиняє навчання своїх «найпотужніших моделей» після інциденту, під час якого модель намагалася обійти обмеження доступу до інтернету. OpenAI повідомила WSJ, що GPT-6.1 не належала до «найпотужніших моделей», яких стосувалося це рішення. І хоча GPT-6.1 не випустять у нинішньому вигляді, компанія заявила, що планує використовувати ту саму базову модель для подальших циклів навчання, які, як сподіваються в OpenAI, приведуть до створення майбутніх моделей покоління GPT-6.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.