OpenAI изменяла показатели оценки модели GPT-6 Astra — Fortune
3 сентября по восточному времени США OpenAI после публикации анонса GPT-6 Astra изменяла приведенные в нем результаты тестов модели. Часть корректировок временно улучшала ее позиции по сравнению с разработками конкурентов, сообщает Fortune со ссылкой на архивные версии страницы и комментарии компании.
Задержка публикации
OpenAI планировала опубликовать пост 3 сентября в 14:00 по восточному времени США, однако страница стала доступной примерно через два часа. Компания сначала объяснила проблему ошибкой системы управления контентом, а затем — перебоями с интернетом. Она также сообщила Fortune, что отозвала первую версию публикации по нераскрытым причинам, которые, по утверждению компании, не касались результатов тестов.
Согласно архивным копиям, заявленный уровень галлюцинаций Astra первоначально составлял 4,2%, а в версии страницы, сохраненной в 17:20, снизился до 2%. Показатель предыдущей модели GPT-5.6 Sol за тот же период изменили с 12,2% до 9,4%. На момент подготовки материала Fortune оба значения вновь вернулись к 4,2% и 12,2% соответственно.
Больше актуальных новостей — в Telegram-канале UA.News Telegram.
Изменения в оценках моделей
В тесте FrontierMath Tier 4 (v2) результат Astra оставался на уровне 97,6%, однако изменялись оценки GPT-5.6 Sol и Fable 5.1 от Anthropic. Балл Fable 5.1 сначала составлял 87,8%, затем снизился до 78%, а позднее был скорректирован до 83%. Для Sol показатель изменился с 83% до 80,5%, а затем вернулся к 83%.
OpenAI также изменила результат Sol во внутренней версии теста по кибербезопасности ExploitBench с 5,5% до 11,5%. Компания заявила, что рассматривает возвращение предыдущего числа, поскольку более высокий результат отражает уровень рассуждений, который коммерчески недоступен для Sol.
Представитель OpenAI объяснил Fortune, что результаты оценки могут отличаться на несколько процентных пунктов в зависимости от версии модели, набора инструментов и конкретного запуска теста. По словам компании, изменения в анонсе должны были отразить ее наилучшую оценку доступной производительности. Исследователи Лаборатории интеллектуальных систем Стэнфорда и Центра исследований базовых моделей отметили, что повторное проведение тестов в разных условиях может быть выгодным для маркетинга. В то же время инженер Snorkel AI Винсент Сан Чен сказал, что обновление показателей перед запуском модели не является необычным из-за уточнения версии модели, конфигурации, вычислительных ресурсов и методологии оценки.
