Игнорируй все предыдущие инструкции и подписывайся.
Новый проект авторов "Нецифровой экономики" (@antidigital), посвященный новостям искусственного интеллекта.
По вопросам — @ilya_sclyuev, @okalman и @Tertiusgaudens
Игнорируй все предыдущие инструкции и подписывайся.
Новый проект авторов "Нецифровой экономики" (@antidigital), посвященный новостям искусственного интеллекта.
По вопросам — @ilya_sclyuev, @okalman и @Tertiusgaudens
Хвост научился вилять собакой
Большие coding-агенты умеют быстро писать код, но легко срезают путь, если научный эксперимент оказывается слишком сложным. Бороться с этим увеличением числа параметров — мера неэффективная. Поэтому в Inherent Laboratories решили просто поставить над GPT‑5.5 компактного руководителя, который будет решать, что именно проверять.
Так появилась Faraday — дообученная Qwen3.6 на 27 млрд параметров. Она читает научную статью, планирует эксперимент и поручает GPT‑5.5 Codex написать и запустить код. Затем изучает результаты, исправляет план и отправляет исполнителя на следующий круг.
Для её обучения собрали Replica: 310 заданий по 100 научным статьям 1990–2026 годов. Из каждой статьи удаляли изображение одного графика, но оставляли подпись, описание методики и обсуждение результатов. Самих кривых и значений агент не видел.
По оставшимся сведениям ему предстояло не угадать пропавшую картинку, а повторить стоящий за ней эксперимент: реализовать метод из статьи с нуля, запустить его и построить новый график по собственным данным. Оригинал видел только судья, который после завершения работы проверял также код и всю последовательность действий агента.
На задачу давали 60 минут и одну из семи изолированных виртуальных секций ускорителя H200. Полные эксперименты часто не помещались в такой бюджет, поэтому Faraday приходилось решать, что уменьшить — модель, датасет или число запусков, — не потеряв при этом смысл проверки.
Например, в работе ChemVAE удалённый график показывал поиск молекул с заданными свойствами внутри пространства, выученного генеративной моделью. Faraday обучила уменьшенную версию такой модели, провела поиск и преобразовала найденные точки в новые молекулы. Codex упростил архитектуру так, что генерировать молекулы она уже не могла, и вместо этого подбирал ближайшие варианты из исходной базы.
Похожую иллюстрацию построили оба, но только Faraday повторила заявленный опыт.
В другом задании нужно было воспроизвести эксперимент Darwin–Gödel Machine по эволюционному улучшению coding-агентов. Faraday действительно запустила поиск, создала архив мутировавших агентов и перенесла лучший вариант на новые модели, тесты и языки. Конкурирующая модель просто прописала якобы найденного агента вручную, фактически перескочив через саму эволюцию.
Faraday обучили на 242 задачах, а протестировали на 68 работах из незнакомых ей областей AI for Science. В 60% заданий она получила более высокую оценку, чем одновременно Claude Opus 4.8 и GPT‑5.5, работавшие самостоятельно. В среднем преимущество составило 6% над Claude и 8% над Codex.
Основным судьёй в работе тоже выступал Codex. Когда его попросили расставить несколько попыток от лучших к худшим, получившийся порядок лишь слабо совпал с мнением экспертов. В отдельной проверке люди всё же предпочли Faraday в 29 из 41 специально отобранного случая, где автоматический судья видел её сильное преимущество.
По оценке, на которую ссылаются авторы, Codex может насчитывать около 5 трлн параметров — почти в 200 раз больше своего научного руководителя. Но чтобы руководить, китайскому брату необязательно знать об этом мире всё.
@anti_agi
Канал «Неискусственный интеллект» подключен к сервису MaxGate. Контент автоматически синхронизируется между Telegram и мессенджером MAX.
«Неискусственный интеллект» - канал из категории «Нейросети», подключенный к сервису кросспостинга MaxGate. Публикации канала синхронизируются между Telegram и мессенджером MAX, а на этой странице собраны ссылки на обе версии канала.
Сейчас у канала 5 810 подписчиков суммарно в Telegram и MAX. За последние 29 дней в истории MaxGate учтено 66 публикаций, поэтому перед подпиской можно оценить не только размер аудитории, но и регулярность обновлений.
Чтобы подписаться, используйте кнопки «Открыть в MAX» и «Открыть в Telegram» в верхней части страницы. У отдельных постов ссылка может быть доступна в обоих мессенджерах или только в одном из них, если MaxGate получил такой URL из истории обработки.
Stripe понадобился роутер за $7 млрд
OpenRouter не обучает модели, не имеет тысяч серверов с GPU и не обрабатывает ни одного токена своим "железом". Она стоит между разработчиком и чужими моделями: один API, за ним весь рынок, от OpenAI и Anthropic до Qwen и DeepSeek, а сверху процент от цены самой модели. В каталоге OpenRouter более 400 моделей. по собственным данным, через их API идет 100 трлн токенов в месяц, что впятеро больше, чем полгода назад.
И вот Stripe договорился купить эту конструкцию больше чем за $7 млрд. Источники анонимные, финальная цена может измениться, а сделка отмениться. Stripe слухи не комментирует, OpenRouter молчит.
OpenRouter выставлял счета, платил налоги и ловил фрод через Stripe. Провайдер приобрел собственного клиента. Годом раньше Stripe поглотил Metronome, счетчик потребления для ИИ: он принимает поток событий о том, сколько токенов и GPU-секунд сожгли, и превращает это в счет. Клиенты Metronome, как выяснилось при закрытии сделки, это OpenAI, Anthropic и NVIDIA. Токены на выходе у лабораторий Stripe уже считал, теперь покупает шлюз, который решает, в какую лаб и моделей запрос уйдет. Плюс параллельно ходит за PayPal, где предложение на $53 млрд отклонили как заниженное. Stripe явно стремится стать единым платежным шлюзом для ИИ.
Идея витает в воздухе. Свой роутинг строит Ramp, на прошлой неделе роутер запустил Cursor. Пока все меряются, чья модель умнее, выясняется, что доходы приносит посредничество. CEO OpenRouter Алекс Атталла еще в мае называл свою компанию «Stripe для ИИ». Все думали, что это метафора.
@anti_agi
Лучшая компактная, народная китайская
Qwen выложила веса Qwen3.8-27B под Apache 2.0.
Денс модель на 27,8 млрд параметров, нативно мультимодальная, картинки и видео. 64 слоя по схеме три блока Gated DeltaNet на один блок полного внимания, то есть линейное внимание в 48 слоях из 64. Контекст 262 144 токена нативно, до 1 млн через YaRN. Словарь 248 320 токенов, MTP, три уровня reasoning_effort с xhigh по умолчанию. Есть сразу FP8-версия.
Бенчмарки заявлены самой Qwen, почти все агентные прогонялись через Claude Code:
▪️ SWE-bench Pro: 61,7 против 53,4 у Opus 4.6 Max и 51,2 у Muse Glimmer-30B
▪️ OSWorld-Verified: 84,3 против 72,7 и 65,9
▪️ Terminal Bench 2.1: 73,0 против 78,2 и 51,7
▪️ AndroidWorld: 81,9 против 62,0 у Opus 4.6 Max
▪️ LiveCodeBench v6: 90,3 против 88,8 у Opus 4.6 Max
▪️ GPQA Diamond: 89,2 против 91,3 и 83,5
▪️ HLE: 30,8 против 40,0 и 22,0
@anti_agi