Reflection AI представляет Beam — открытую модель на 501 млрд параметров для кодинга и агентов
Коротко
Американский стартап Reflection AI анонсировал Beam — открытую Mixture-of-Experts модель с 501 млрд общих параметров и 23 млрд активных, созданную для кодинга, рассуждений и агентных задач. Модель всё ещё проходит финальный ред-тиминг и оценку, регистрация для раннего доступа открыта; компания заявляет, что веса будут опубликованы в октябре под лицензией Apache 2.0. Reflection утверждает, что Beam соответствует более крупным открытым моделям, таким как GLM 5.2, при одной трети — одной четверти вычислительных затрат на инференс; эта оценка не была независимо проверена.
Читать полностью 3 мин чтения
Американский стартап Reflection AI со штаб-квартирой в Бруклине, Нью-Йорк, анонсировал открытую ИИ-модель под названием Beam 5 октября по времени США, сообщают Mynavi News, Impress Watch и GIGAZINE. Модель представляет собой Mixture-of-Experts конструкцию с 501 млрд общих параметров и 23 млрд активных параметров, и компания заявляет, что она создана для кодинга, рассуждений и агентных рабочих нагрузок. В документах говорится, что Beam находится на финальной стадии ред-тиминга и оценки и что регистрация для раннего доступа открыта. Его веса будут опубликованы в октябре под лицензией Apache 2.0 вместе с техническим отчётом, картой модели и программным обеспечением для запуска, оценки и тонкой настройки модели, сообщает Mynavi News. [ 1 , 2 , 3 ]
Компания опубликовала сравнительные показатели для Beam. Mynavi News сообщает о результатах 80,9 на SWE-bench Verified, 80,1 на Terminal Bench v2.1 и 44,4 на DeepSWE v1.1. На Terminal Bench v2.1 это примерно на уровне GLM 5.2 с 81,0, но ниже Kimi K3 с 88,3 и DeepSeek V4.1 Flash с 90,6, тогда как на DeepSWE v1.1 Beam близок к 44,0 у GLM 5.2, но уступает 74,2 у DeepSeek V4.1 Flash. GIGAZINE описал Beam как достигающий паритета с более крупными открытыми моделями, такими как GLM 5.2, и приближающийся к Qwen 3.8-Max на задачах кодинга и агентов, но всё ещё уступающий передовым открытым моделям вроде Kimi K3 по сырым возможностям. [ 1 , 3 ]
Центральное заявление Reflection — эффективность во время инференса. Компания утверждает, что Beam соответствует GLM 5.2 на продвинутых бенчмарках рассуждений, используя около одной трети — одной четверти вычислительных затрат на инференс, и что он конкурирует с GLM 5.2 на некоторых бенчмарках кодинга и агентов, приближаясь к более крупной Qwen 3.8-Max. Mynavi News сообщает, что эта цифра не является измерением: это оценка, полученная на основе данных Artificial Analysis и DataCurve с использованием количества активных параметров и среднего числа сгенерированных токенов, и она не учитывает предобработку промпта, зависящее от контекста внимание и накладные расходы на обслуживание модели, поэтому это не прямое сравнение реальных затрат на инференс. Mynavi News также сообщил, что опубликованные Reflection показатели производительности не были независимо проверены третьей стороной. [ 1 , 3 ]
Что касается обучения, Mynavi News сообщает, что Beam — это текстовая модель, предобученная на 23,8 трлн токенов, отобранных из веба, публичных данных и лицензированных проприетарных наборов данных, с расширением контекста до 1 млн токенов на этапе промежуточного обучения, чтобы она могла обрабатывать длинные репозитории кода и документы. Компания сообщила, что для обучения с подкреплением использовались 10 500 устройств NVIDIA GB300 в течение четырёх недель, было сгенерировано более 100 млн роллаутов, задействовано около 1,3 млрд песочниц и примерно 1 млн сред обучения для кодинга, агентных задач и STEM. GIGAZINE сообщил те же цифры по GPU и роллаутам. Reflection заявила, что не увидела признаков выхода производительности на плато по мере увеличения вычислительных ресурсов для RL в рамках оцениваемого диапазона, и ввела параметр «усилие рассуждения», позволяющий пользователям обменивать использование токенов на производительность на более сложных задачах. [ 1 , 3 ]
Что касается безопасности и выравнивания, компания сообщила, что обучила отдельные модели с помощью конвейеров контролируемой тонкой настройки и обучения с подкреплением из предобученных чекпоинтов, а затем объединила их возможности в одну модель с помощью «multi-teacher on-policy distillation». Результаты оценки безопасности будут опубликованы в техническом отчёте, и компания планирует открыть исходный код своих внутренних оценок безопасности. Mynavi News добавил, что Beam — первая модель в серии и что Reflection уже начала обучение преемника, а партнёры по распространению и интеграции с открытыми библиотеками будут доступны при запуске. [ 1 ]
Mynavi News сообщает, что Reflection AI была основана в 2024 году двумя исследователями из Google DeepMind, базируется в Бруклине, Нью-Йорк, и привлекла около 4,7 млрд долларов от инвесторов, включая NVIDIA, Sequoia Capital и Lightspeed Venture Partners. То же издание сообщает, что летом компания заключила контракты общей стоимостью более 7 млрд долларов с SpaceX и Nebius, обеспечив мощности GB300 до 2029 года. Эти детали о компании встречаются только в Mynavi News. [ 1 ]
Почему это важно
Beam представлен производителем как американский открытый ответ китайским открытым моделям, и его заявленное преимущество — эффективность инференса, а не абсолютные результаты. Если эффективность подтвердится за пределами собственных оценок компании, это может снизить стоимость запуска рабочих нагрузок для кодинга и агентов — однако в документах отмечается, что третьей стороны, подтвердившей заявления о производительности или стоимости, пока нет.
Ключевые факты
- Reflection AI анонсировала открытую модель Beam 5 октября по времени США. [ 1 , 2 , 3 ]
- Beam — это Mixture-of-Experts модель с 501 млрд общих параметров и 23 млрд активных параметров. [ 1 , 2 , 3 ]
- Компания заявляет, что она предназначена для кодинга, рассуждений и агентных рабочих нагрузок. [ 1 , 2 , 3 ]
- Reflection AI сообщает, что модель находится на финальной стадии ред-тиминга и оценки, регистрация для раннего доступа открыта. [ 1 , 2 , 3 ]
- Веса будут опубликованы в октябре под лицензией Apache 2.0 вместе с техническим отчётом, картой модели и программным обеспечением. [ 1 , 2 , 3 ]
- Reflection сообщила о предобучении на 23,8 трлн токенов и расширении контекста до 1 млн токенов. [ 1 , 3 ]
- Reflection сообщила о результатах бенчмарков: 80,9 на SWE-bench Verified, 80,1 на Terminal Bench v2.1 и 44,4 на DeepSWE v1.1. [ 1 ]
- Reflection заявляет, что для обучения с подкреплением использовались 10 500 устройств NVIDIA GB300 в течение четырёх недель и было сгенерировано более 100 млн роллаутов. [ 1 , 3 ]
Подтверждено несколькими источниками
- Reflection AI анонсировала открытую ИИ-модель под названием Beam. [ 1 , 2 , 3 ]
- Beam — это Mixture-of-Experts модель с 501 млрд общих параметров и 23 млрд активных параметров. [ 1 , 2 , 3 ]
- Компания заявляет, что модель ориентирована на кодинг, рассуждения и агентные рабочие нагрузки. [ 1 , 2 , 3 ]
- Модель проходит финальный ред-тиминг и оценку, ранний доступ открыт для регистрации. [ 1 , 2 , 3 ]
- Веса модели, технический отчёт и карта модели будут опубликованы в октябре. [ 1 , 2 , 3 ]
Пока неясно
- Подтвердятся ли заявленные результаты бенчмарков и эффективность Beam при независимом тестировании. Mynavi News отмечает, что опубликованные Reflection показатели производительности на данный момент не были независимо проверены третьей стороной.
- Точная дата в октябре, когда будут выпущены веса и документация. В документах лишь говорится, что публикация планируется на октябрь.
- Сколько вычислительных затрат на инференс Beam фактически использует по сравнению с GLM 5.2. Mynavi News сообщает, что цифра от одной трети до одной четверти — это оценка, полученная на основе данных Artificial Analysis и DataCurve, а не измерение, и она не учитывает предобработку промпта, зависящее от контекста внимание и накладные расходы на обслуживание.
- Финансирование Reflection AI и её контракты с SpaceX и Nebius. Эти детали встречаются только в одном документе — Mynavi News.