Macaron-V1:RL,让 GLM5.2 再次伟大


新鲜速递

最近几天,模型行当风起云涌

而我们的 MindLab 也拿出了的作品 Macaron V1:通过后训练,让 GLM5.2 再次伟大

MindLab 成立于去年 12 月,现如今是唯一完成对 GLM-5.1/5.2 完成后训练的外部团队Mind Lab 成立|64 张卡跑万亿参数 RL,开源

作为当下国内最受瞩目的 NeoLab 之一,本文重点聊聊 MindLab 他们的模型成果、技术路线以及优化方式

模型与训练

NeoLab 的研究方向,是在现有基模下进行 LoRA 训练,即:对现有模型,取出大约 0.5% 的核心参数来训练,并有效的提高原有模型的素质。在 MindLab 成立之初,这套方法就在在 Kimi K2 进行了验证:64 张 H800 搞定万亿参数模型的强化学习

但后训练有个经典难题:对话、推理、编程、工具调用等能力混在一起训,往往按下葫芦浮起瓢。团队为此独创了 Mixture-of-LoRA(MoL):在冻结的基座上挂载多个独立的 LoRA 专家,每个专家专精一个方向,各自在隔离的适配空间中优化,彻底消除能力间的相互干扰。这套方法先是在 GLM-5.1 上跑通了预览版 Macaron-v1-Preview

随后,也就是在正式版 Macaron V1 中,团队把基座换成了 GLM 5.2,并对模型能力进行了全面升级

V1 提供两款变体:

旗舰 Venti(748B):基于 GLM-5.2(原生 1M 上下文),通过 4 个 1B 的 LoRA 专家分别覆盖 Chat、Agent、Coding、UI 四大方向,切换由显式 Router Tool 控制,未来新增能力的话,只需再挂一个 LoRA

轻量 Tall(35B):基于 Qwen 3.6 后训练,专为本地部署优化。

同时,团队还通过自研的 LongStraw 技术,将 GLM 5.2 的上下文扩展至 2M,并通过将共享提示词复用为常驻状态,大幅降低长序列开销。除了模型本体,团队还同步打造了三个关键配套,与模型联合训练:

UI4A:通用生成式 UI 架构,让模型能渲染交互式视图(不仅是文本),不依赖特定基座,即使未经微调的模型也能驱动,独立于 Macaron 的通用底座

REPL Harness:为模型提供持久的 Python 运行环境,模型可用 save_tool 自行编写工具,用 promote_tool 将其提升为跨会话可用的全局工具

MinT 后训练平台:MindLab 自研的训练基础设施,核心设计是 Actor 与 Learner 之间只传递 Adapter(而非完整权重),天然契合 MoL 架构,支持百万级 Adapter 目录,端到端可覆盖万亿参数规模

模型跑分

我曾经问锴杰,怎样才能让模型智能不断提升?得到了一个回答:来自真实产品环境的奖励函数

从模型愿景上来说,马卡龙是希望能够在日常生活中真正帮上忙,并且是长期持续为创造价值,为此他们自建了两个基准,用于指导模型训练,如下:

Macaron ChatBench

作为 Agent 最基本的能力,需要评测 Agent 在长上下文中是否对用户保持诚实,而非「先把事情搞砸,然后道歉」

Macaron LivingBench

这是一个模拟的沙盒环境,包含三种相互关联的动态机制:动态噪声、动态生存环境以及动态用户。评测观察模型是否能够持续理解用户的需求,验证信息准确性,重新规划任务路径,在用户保持耐心的情况下完成任务,说白了:完成任务,然后提供更好的体感

除此之外,还有一些常规 Bench,也让大家看一下成色

benchmark 对比图

除此之外,我不知道是不是由于还在内测,用的人很少…就是这个模型快的离谱,我让他自己写了个自己的测速脚本,然后看看自己的速度:320字/秒

我觉得它在糊弄我…于是我还录了个屏,让他做打点标记

我问锴杰:对于推理速度,你们干了啥?

锴杰:的确做了速度性能的优化,但太强调的话,我怕后面大家体验如果和你的实测指标不一致,会生气

好的,我绝对不说速度的事儿,另外还有个事情我得说一下,在我写这篇文章的时候,我让 Macaron 帮我去迭代了我的「大撒币计划」:速测 Qwen3.8 预览版:我用 1 小时,开发了套撒币系统

我是这么要求他的…四舍五入啥也没说,让他自己干

然后…它帮我迭代了所有的 ux,并且额外修了点 bug

看几个案例

这里我就直接放点官方的 Case 了

Coding:用 Three.js 做了一个夜航船 3D 网页。第一人称站在木船上,河灯飘在两侧,靠近时浮出诗句

夜航船 3D 网页(马卡龙版)

同样的 prompt,GPT 5.6 也做了一版

夜航船 3D 网页(GPT版)

Agent:从零构建一个混沌磁摆模拟器。小球在重力、阻尼和三枚磁铁作用下运动,实时渲染分形区域

混沌磁摆模拟器

UI4A:可交互的 3D 魔方带步骤演示,数字绘画笔刷,3D 可扫描二维码

3D魔方

然后这里还有个我觉得很有意思的 Case:3D 二维码…

(提问:3d二维码是几维码?)

对了,测试 UI4A 可以用 Mind Lab 发的 Claude Code 插件 Macaron Artifacts

github.com/mindverse-ltd/macaron-artifacts

接进 Claude Code

现在大家基本都在用 Claude Code 调各种模型,我整理了一下接法

打开 CC Switch,选顶部 Claude Code 图标,点右上角 +,选「手动添加」

Name 随便填,比如 Macaron-V1,Base URL、API Key、Model 都留空,核心是下面这段 JSON:

{ “env”: { “ANTHROPIC_BASE_URL”: “https://mintcn.macaron.xin”, “ANTHROPIC_AUTH_TOKEN”: “sk-xxxx”, “CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC”: “1” }, “model”: “macaron-v1-coding-venti” }

CC Switch 配置截图

我是看着 Mind Lab 从成立的,看着他们团队建立,看着他们跑通 MoL,再到发布自己的模型,不断着验证自己的判断:通过后训练让模型持续变强,经由多专家协同让能力可生长

            预览时标签不可点