«Самая умная и согласованная модель», 97,6% на FrontierMath Tier 4. Брокман: «мы вошли в эру AGI», Хуанг вторит.
💡 Моя оценка: ARC Prize уже показал, что топ-результат получен на специальном дорогом харнессе, а без него — 62,7%. Классика жанра: маркетинг впереди методологии.
Крупнейшая сделка месяца в open-source-инфраструктуре. Обещают оставить площадку открытой.
💡 Верим, но следим: такие обещания редко переживают два квартала.
Мультимодальная модель в новой архитектуре, ввод при cache-hit подешевел до 60%.
💡 Экономика инференса падает быстрее, чем успевают писать обзоры. Для конвейеров вроде моего это прямые деньги.
10 000 ИИ-систем, 88 часов, 166-страничное доказательство. Без независимой проверки и без признания Института Клэя.
💡 Главный вывод: ИИ-доказательствам нужен тот же peer review, что и человеческим. «Решено» ≠ «проверено».
Включая Теренса Тао — о «серьёзном рассогласовании» между ИИ-компаниями и математическим сообществом.
💡 Не запрет, а предупреждение: превращение математики в бенчмарк разрушает условия, в которых рождаются идеи. Аргумент сильнее любого пресс-релиза.
Часы работы с самопроверкой; параллельно кредитная линия на $15 млрд и оценка $965 млрд перед IPO.
💡 Гонка перешла из моделей в корпоративные финансы. Инженерам от этого ни горячо ни холодно — а вот цены на инференс падают.
73,7% на DeepSWE v1.1, заточена под автономных агентов в разработке. Meta не отстаёт: Muse Spark 1.3 сократил вызовы инструментов на 20%.
Модели дешевеют, инфраструктура консолидируется, а главная битва — за доверие к результатам. Поэтому на этом сайте каждая цифра считается системой и показывается публично — на открытой кухне.