Сентябрь еще не кончился, а мы уже опять в новом мире. Вот три недели анонсов:
1 сентября — Claude Fable 5.1.
Результат на AutomationBench вырос с 17,1% до 31,4% — на 84%. Речь об автоматизации бизнес-процессов: не просто ответить на вопрос, а выполнить рабочую задачу.
3 сентября — GPT-6 Astra.
72,6% на OSWorld 2.0, выполнение задач примерно на 47% быстрее GPT-5.6 Sol. Следующий шаг в управлении компьютером: агент не объясняет, куда нажать, а нажимает сам.
8 сентября — Meta Muse.
Meta включается в гонку персональных агентов против Grok и Instinct. Компания сообщает о 2,8 млн загрузок за 12 дней. Конкуренция уже не за лучший чат, а за роль твоего личного помощника.
15 сентября — Jev от TypeSafe AI.
Вместо генерации текста — структурированные решения. По внутренним тестам компании, до 194 раз быстрее и до 445 раз дешевле протестированных LLM-альтернатив. Вопрос уже не «какую языковую модель взять», а «нужна ли здесь вообще языковая модель».
22 сентября — Claude Opus 5.5.
По тестам Anthropic, в большинстве задач — уровень Fable 5.1, но на 40% дешевле в работе, чем Opus 5, с генерацией ответов более чем на 30% быстрее. Меняется экономика: длинные агентные задачи становятся доступнее, а не просто лучше выполняются. Внезапно выясняется, что он умеет генерить процедурно мультфильмы на js. Также антропики признаются, что открыли био лабораторию.
22 сентября — GPT-6 Sol и Luna.
OpenAI переносит достижения Astra в более доступные модели и снижает цены API примерно вдвое относительно GPT-5.6. По внутренним тестам, Sol допускает примерно вдвое меньше фактических ошибок, чем предшественник. А Luna на максимальном уровне рассуждений превосходит GPT-5.6 Sol на среднем в тесте управления компьютером — при десятикратно меньшей стоимости задачи. Вчерашний флагман становится ориентиром для сегодняшней бюджетной модели. Astra зато как оказывается может водить машину и решает еще 11 «вечных» математических задач.
За три недели меняются возможности, скорость, экономика, архитектура и подход к сборке агентов.
@maxrepost 👾