关于ZAKER Skills 合作
雷锋网 2小时前

基元律动发布模型 NeoHorse,探索 Harness 驱动的 RSI 路径

在一次项目排期测试中,一个 4B 基础模型找到了工作目录中的文件,却漏读了一封包含最新依赖约束的邮件。它按照过时信息生成计划,并把文件写到了错误位置。

这一案例来自基元律动(TokenRhythm)近日发布的技术报告。该公司联合无问芯穹、清华大学、北京大学、阿里巴巴等机构,推出首个 Agent-Native 模型 NeoHorse-1,包含 4B 和 9B 两个版本,探索将 Agent 使用工具、接收反馈和修正错误的经验转化为模型能力。

基元律动由前华为诺亚方舟实验室主任、盘古大模型负责人王云鹤创办。公司此前开发的开源 Routing Harness 系统 OpenSquilla,用于在 Agent 执行任务时选择和组织不同模型。NeoHorse 将这条技术路线延伸至模型训练。

据技术报告,训练语料以包括 OpenSquilla 在内的 Routing Harness 产生的执行轨迹为核心,并辅以公开数据。这些轨迹保留了能力需求预测、路由选择、模型响应、工具调用和环境反馈,经完整性检查及目标完成、证据一致性、错误恢复等质量评估后,用于后训练。

团队利用路由信号估计任务所需能力、安排训练顺序,并结合 Agent 执行监督和在策略蒸馏(On-Policy Distillation)更新模型。其中,在策略蒸馏由教师模型针对学生实际生成的内容提供指导。

报告在 11 项涵盖 Agent 执行、工具交互、代码和指令遵循的基准上进行了评测。报告所列的 4B 级模型中,NeoHorse 4B 的未加权平均分最高,并在五项基准上超过 Qwen3.5-9B 底座。改善主要集中在流程清晰、反馈可观察、结果可验证的任务上;更大模型在复杂状态维护、长程调试和失败恢复中仍有优势。

这一过程是递归自我改进(RSI)的单轮工程验证:Agent 执行轨迹,评测暴露能力短板,训练选择随之调整,模型完成更新并重新返回 Harness。

研发过程中,中国领先的 AI 原生基础设施服务商无问芯穹,依托模型算法与芯片硬件的协同优化能力,为项目提供基础设施支持与 Infra 优化技术能力,提升训练效率、优化成本,加快了从任务信号处理到模型训练的迭代。清华大学、北京大学团队也参与了算法和训练方法创新,共同探索提高训练投入的能力回报,推动形成更陡峭的训练 Scaling 曲线。

NeoHorse 分别基于阿里巴巴开源的 Qwen3.5-4B 和 Qwen3.5-9B 进行后训练。依托这一开源生态,合作各方将模型底座、算法研究、算力基础设施与 Agent 执行反馈连接起来,共同探索国产开源模型的训练与迭代路径,推动产业与学术研究之间的协作。

对基元律动而言,NeoHorse 现阶段的意义,在于为其技术设想提供模型层面的证据。此次合作也为这一探索提供了持续迭代的基础:让开源模型进一步学习任务执行中的经验,并检验 Harness 与模型协同改进的潜力。

雷峰网 雷峰网

雷峰网

雷峰网

读懂智能&未来

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容