Mixture-of-LoRA 隔离多能力后训练

Macaron V1 的核心做法是在冻结基座上挂载多个独立 LoRA 专家,让 Chat、Agent、Coding、UI 分别在隔离的适配空间优化,再通过显式 Router Tool 切换,降低多能力混训时互相干扰的问题。旗舰 Venti 基于 748B 的 GLM-5.2,用 4 个 1B LoRA 专家;轻量 Tall 为 35B,本地部署优先。

配套机制包括:LongStraw 把上下文从原生 1M 扩展到 2M;UI4A 负责生成式界面;REPL Harness 给模型持久 Python 环境并允许把临时工具提升为跨会话工具;MinT 仅在 Actor 与 Learner 间传 Adapter,支撑大规模后训练目录。

适用边界:适合已有强基座、希望低成本扩展多种专业能力的团队;效果仍依赖真实产品奖励函数、路由质量和各专家数据隔离,不能只凭展示案例判断泛化。

原文:赛博禅心 - Macaron-V1:RL,让 GLM5.2 再次伟大 - 3934419561-2247519020_1