10 главных новостей ИИ за 30.09–01.10 — коротко о каждой.
Synthesis Without Training: An Inference-Only Pipeline for Tabular, Temporal, and Relational Synthetic Data — Предложен подход GENSCRIPT, который генерирует синтетические данные без обучения модели: вместо этого детерминированный статистический профиль исходных данных (типы колонок, диапазоны, пропуски, категории, корреляции) передаётся языковой модели для вывода семантики полей и ограничений целостности, после чего кодирующий агент компилирует профиль и ограничения в исполняемый сэмплер. Подход единообразно поддерживает табличные, временные и реляционные данные без специализированных моделей и инженерии признаков. На четырёх табличных бенчмарках GENSCRIPT строит генераторы за 2 минуты и генерирует 50 тыс. строк за 6 секунд, отставая от ведущих методов по маргинальной точности на несколько пунктов, но единственный идеально сохра Источник
Google DeepMind Unveils Gemini 4 Argon with 1M Output Tokens for Coding, Knowledge Work and Cyber Defense — Google DeepMind представила модель Gemini 4 Argon с поддержкой до 1 млн выходных токенов, предназначенную для задач программирования, интеллектуальной работы и киберзащиты. По большинству бенчмарков Gemini 4 Argon опережает GPT-6 Astra и Claude Opus 5.5, однако доступ к ней пока ограничен. Источник
More Programs or More Rolls? Separating Coverage from Specialization in LLM Harnesses — Авторы предложили метод контролируемой оценки, позволяющий отделить покрытие ответов от реальной специализации при автоматической генерации программ-обвязок для LLM. На 386 задачах MATH-500 сравнили восемь сгенерированных обвязок с базовой линией и девятью её идентичными копиями: одинаковые программы дали 2,16 п.п. разрыва по усреднённому по повторам оракулу, а преимущества сгенерированных программ оказались в основном неустойчивыми — потери относительно базовой линии сохранялись на 100 задачах во всех трёх повторах, тогда как устойчивые выигрыши — лишь на одной задаче. Замороженный селектор не дал прироста (0,00 п.п.), обе группы достигли 98,70% покрытия оракула при Источник
Grab a Coffee: Future-Aware Guidance for Discrete Diffusion with Compiled Objectives — Представлен фреймворк COFFEE для управляемой генерации в дискретных диффузионных моделях, который позволяет применять цели уровня последовательности без экспоненциального перебора всех вариантов заполнения нерешённых токенов. Метод разделяет последовательностную зависимость и целевую функцию: «носитель» без цели агрегирует маргинальные распределения токенов от денойзера, а скомпилированная модель конечных состояний фиксирует влияние их комбинаций на предпочтение уровня последовательности. COFFEE поддерживает как жёсткие ограничения, так и обученные мягкие цели, не требуя переобучения диффузионной модели, и протестирован на символьных, языковых и биологических бенчмарках. Источник
Каждый LLM-фреймворк описывает инструмент по-своему — Инструменты для LLM — это функции с именем, описанием и схемой аргументов, которые приходится переписывать под каждый фреймворк. Одна и та же функция оборачивается через tool() в AI SDK, registerTool в MCP-сервере и defineTool в Genkit, хотя сама логика не меняется. Источник
Anthropic brings Claude to civilian agencies as its fight with the Pentagon drags on — Anthropic запустила Claude for Government для федеральных и государственных агентств США, работающий в среде FedRAMP High — самом строгом уровне безопасности для облачных сервисов. Агентства получают те же функции, что и корпоративные клиенты, с оплатой по факту использования и фиксированными лимитами расходов, включая бюджеты для отдельных департаментов. Пентагон не будет использовать платформу, поскольку по-прежнему классифицирует Anthropic как риск для цепочки поставок. Источник
An Exact Generate - Transform Decomposition of Small-LLM Team Scaling Across Orchestration Architectures — Масштабирование команды LLM-агентов даёт разный эффект в зависимости от задачи: при росте числа вызовов с трёх до тридцати точность на арифметических задачах GSM8K и GSMHard повышается до 17 пунктов, тогда как на ARC, GPQA и MMLU — не более чем на четыре, причём для всех восьми архитектур оркестрации. Архитектура Proposer-Critic сильнее всех выигрывает на арифметике и в совокупности обходит остальные при наибольшем бюджете вызовов, но на других задачах оказывается среди слабейших, и ни одна архитектура не побеждает везде. Авторы объясняют это точным разложением на генерацию и преобразование: изменение точности раскладывается на экстенсивный выигрыш от покрытия кандидатов и интенсив Источник
Photon held a funeral for mobile apps. Now it has $4.5M to help replace them with agents. — Стартап Photon привлёк $4,5 млн на разработку AI-агентов, работающих через iMessage, SMS/RCS, электронную почту и другие мессенджеры. Компания делает ставку на то, что потребители будут всё чаще обращаться к агентам вместо скачивания приложений. Источник
Google announces Gemini 4 and says it’s so capable that only ‘trusted cyber defenders’ can have it right now — Google представила новую фронтирную модель Gemini 4 Argon, которая, по словам главного архитектора по ИИ и старшего вице-президента Google DeepMind Корая Кавукчуоглу, обеспечивает передовую производительность в сложных рабочих процессах — от реальной разработки ПО до корпоративной работы в юриспруденции и финансах и кибербезопасности. Доступ к модели сейчас ограничен: компания предоставляет её только «доверенным специалистам по киберзащите». Источник
Opus 5.5 loves to tell you ‘this matters’ (and other AI writing tells) — Opus 5.5 в 23 раза чаще людей использует слово «dependable» («надёжный»), что стало его главной отличительной чертой. Этот и другие речевые маркеры выдают тексты, написанные ИИ. Источник