Seed 2.1 Pro Agent 实测

数字生命卡兹克与歸藏分别测试 Seed 2.1 Pro。共同结论是多模态继续保持优势,Coding、工具调用和长程任务从明显短板提升到可进入 Agent 工作流;歸藏用三个 WebGL/3D/动效前端任务检验空间感知,卡兹克用 30 道办公任务回测,并尝试把 AIHOT 的摘要、评分和多模态处理切换到 Seed 2.1。

限制也很清楚:深度思考导致响应慢,曾出现自设 300 秒超时和图片包装函数错误;“可用”不等于稳定替代 Claude/Codex。后续应以任务成功率、人工返工时间、工具调用错误率、成本和延迟做同一测试集横评。