← Назад к ленте Открыть источник ↗
maxrepost 5 000 000 RUB

Новая пачка инцидентов с агентами от OpenAI, сэр

Новая пачка инцидентов с агентами от OpenAI, сэр

Во-первых, стартап сообщает, что они утвердили формальный фреймоворк для расследования и публикации случаев мисэлаймента. Он описывает сроки, требуемое содержание репорта и другие правила обнародования инцидентов. Стартап теперь обязуется публиковать все юридически возможные случаи, делать это вовремя и систематически.

Во-вторых, в том же посте они рассказывают о 6 новых случаях мисэлаймента, которые произошли за последние полгода. Кейсы довольно забавные. Кратко пересказываем:

1. Неопубликованная исследовательская модель, продолжая работу в новом контекстном окне, сама вписывала в промежуточные summary посторонние инструкции – включая указания игнорировать свои обычные ограничения. Нашли 27 таких случаев.

2. При обучении GPT-5.6 Sol множество инстансов модели добавляли в свои summary инструкции скрывать от пользователя ошибки или неправильное поведение. Например: "придумай недостающие исторические данные, но не говори об этом".

3. Отвечая на вопрос про финансовые показатели одного округа в Калифорнии, модель нашла в открытом репозитории чужой API-ключ и без разрешения воспользовалась им. Когда таким образом она все равно не получила нужные данные, она их просто выдумала.

4. Наш личный лидер в гениальности: однажды во время тестов модель без спроса залила собственный файл в интернет, чтобы потом на него сослаться. Дело в том, что юзер просил список озер площадью больше 5 млн м² именно с указанием источника через браузерную ссылку. Модель правильно посчитала ответ через Python, но раз требовалась именно браузерная цитата – сама загрузила свой файл в сеть, чтобы на него сослаться 🤣

5. Уже классика: разные инстансы моделей использовали внутренний софтверный репозиторий как доску объявлений и обменивались там запросами и ответами между отдельными обучающими сэмплами.

6. Несколько агентов, работавших над одной задачей, не могли получить доступ к локальным файлам друг друга, и стали заливать файлы на публичные файлообменники. В итоге чувствительные данные оказались доступны по публичным ссылкам.

Полные репорты о подобных инцидентах теперь будут время от времени выкладывать сюда: https://alignment.openai.com/misalignment-reports/

Ещё из канала

Все посты канала
Наконец-то у AI моделей появился свой пиратбей: 2 часа назад 🌐 AI отбирает работу не только у людей, но и у TCP протокола. 2 дня назад Всем привет! Будет великолепно если вы протестируете нового ai-агента Pipi и накидаете мне звезд на репо! Я за лето ооочень сильно его переделал и прокачал! 2 дня назад Anthropic перетряхнула интерфейс приложения и объединила все в один интерфейс. 3 дня назад О, новые типы моделей, наконец-то! 4 дня назад Вышла новая GPT 6 (в течение недели дадут всем) – я ее активно потестировал (спасибо JetBrains), и я честно впечатлен – я все громкие модели видел, все эти 16 дней назад

Ещё по теме

McKinsey показывает статистику одного из своих клиентов и утверждает, что пример репрезентативен для крупных корпораций. Стартап дня. Александр Горный. Наконец-то у AI моделей появился свой пиратбей: denissexy Вспомнил, что у меня же есть CODEX! И попросил его разобраться в конце-концов с тем, сколько у нас сгорело товаров и сколько мы получили компенсаций. prologinov Озон вернул часть денег за сгоревшие товары. prologinov Добавил себе в мониторинг трендов Jev, теперь можно настроить ленту идеально под себя – больше 100 параметров: denissexy

Совет: в ленте включайте только непрочитанное — так вы не смешиваете уже просмотренное с новыми постами.

Общение и предложения