尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
NeoHorse-Jev-4B对阵Jev:『开源综合评测第一』的成色检验
NeoHorse-Jev-4B对阵Jev『开源综合评测第一』的成色检验【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B2026年9月基元律动TokenRhythm联合无问芯穹、清华大学、北京大学、阿里巴巴等机构发布 Agent-Native 模型 NeoHorse-1以 4B/9B 双版本切入路由编排Routing Harness驱动的递归自我改进这一前沿路线。随之而来的社区传播中开源 Jev 综合评测第一成为最醒目的标签——4B 量级的模型在 Jev 综合评测中压过一众同量级与更大量级的开源对手。这个第一究竟建立在怎样的评测口径之上在相同的测试集上它赢在哪、输在哪4B 后训练模型距离 9B 级模型还有多远本文结合仓库中的完整评测数据、模型配置与社区实测记录对这张榜单做一次成色检验。一、评测口径先拆榜单再谈第一第一从来不是脱离口径的。NeoHorse-1-4B 的评测结果完整收录在 README.md 的 Evaluation 一节中4B 赛道选取五个代表性开源模型Qwen3.5-4B、Gemma-4-E4B-it、Nanbeige-4.2-3B、Agents-A1-4B、Spark-X2.5-4B覆盖10 项基准、四大能力象限——AgenticQwenClawBench、WorkBuddy Bench、PinchBench、VitaBench、BFCL v4、tau²-Bench、CodingHumanEval、LiveCodeBench v6、Instruction FollowingIFBench、IFEval。BenchmarkQwen3.5-4BGemma-4-E4B-itNanbeige-4.2-3BAgents-A1-4BSpark-X2.5-4BNeoHorse-1-4BΔ vs Qwen3.5-4BQwenClawBench38.4722.9840.6643.1643.5244.686.21WorkBuddy Bench24.6211.6521.0333.3726.4734.419.79PinchBench71.1947.6066.7875.0762.3777.336.14VitaBench21.505.0031.5039.2537.0032.0010.50BFCL v461.0247.1867.2846.6063.7161.790.77tau²-Bench84.2943.6085.0881.0077.7288.464.17HumanEval87.2084.7698.7892.6892.0796.959.75LiveCodeBench v653.7152.0072.50*56.5754.8659.435.72IFBench60.3340.0055.0063.3373.3365.335.00IFEval87.0674.6884.4783.5591.1388.351.29宏平均58.9442.9562.3161.4662.2264.875.93结论的第一步很直白以宏平均计NeoHorse-1-4B 的64.87确实位居六模型之首较基座 Qwen3.5-4B 提升 5.93也领先第二名 Nanbeige-4.2-3B 约 2.6 分。但综合第一的含金量要从三个细节里看综合的边界这 10 项基准全部集中在 Agent 工具调用、编码与指令遵循不包含 MMLU、GPQA、MATH 等知识与数学推理类基准。它是Agent 能力综合榜而非通用智能综合榜——社区的部署文章也反复提醒评测需规避通用基准陷阱两者的指向一致。评测协议README 明确记录了报告口径——SGLang v0.5.17temperature1.0、top_p0.95、top_k20、min_p0.0、presence_penalty1.5且开启 thinking 模式enable_thinkingtrue、force_nonempty_contenttrue。QwenClawBench、WorkBuddy、tau²-Bench 取三次运行结果PinchBench 与 VitaBench 为单次运行。采样参数尤其是高presence_penalty与强制思考对 Agent 类任务的分数影响显著跨模型对比时这些细节比总分更能说明问题。模型的真实身世仓库 config.json 显示这是一次真正的底改而非单纯微调——32 层中 8 层全注意力每 4 层插入 1 层与 24 层线性注意力含conv1d、A_log、dt_bias等 SSM 系参数交替原生上下文 262,144 tokenchat_template.jinja 内建think推理段、tool_callXML 动作格式与tool_response环境反馈封装。Agent-native 不是宣传语而是写进权重与模板的默认行为。二、同一测试集上的实测对比强在 Agent弱在何处把第一拆到单项全面领先的印象会立刻修正为选择性领先。NeoHorse-1-4B 在6 项 Agentic 基准中的 4 项登顶QwenClawBench44.68、WorkBuddy Bench34.41、PinchBench77.33、tau²-Bench88.46均为全场最优其中 WorkBuddy 对次优者拉开 1.04 分、PinchBench 拉开 2.26 分、tau²-Bench 领先 Nanbeige 3.38 分。WorkBuddy Bench 9.79 与 VitaBench 10.50 也说明后训练对弱项基座的拉升幅度可观。但同一张表里NeoHorse 并非没有对手BFCL v461.79仅列第三落后 Nanbeige67.285.5 分——函数调用这一最基础的 Agent 能力反而被同量级对手明显压制VitaBench32.00列第三落后 Agents-A1-4B39.25与 Spark37.00编码与指令遵循全部屈居第二HumanEval 96.95 落后 Nanbeige 的 98.78LiveCodeBench v6 59.43 落后 Nanbeige 的 72.50差距达 13 分IFBench 65.33 落后 Spark 的 73.33IFEval 88.35 落后 Spark 的 91.13。换言之NeoHorse 的第一是靠Agent 执行类基准的四个单项冠军 全项无短板最低单项 VitaBench 也有 32.00远高于 Gemma 的 5.00撑起来的宏平均而编码与指令遵循象限它稳定落在前两名但均非第一。社区在同等测试集上的实测印证了这一画像在格式合规性与推理效率上NeoHorse-Jev-4B 优于对照的 Jev 模型但多步规划准确率略低在 20 题小型评测集中其决策准确率与输出一致性也被反复实测验证。这与榜单数据完全自洽——单步工具调用与格式收敛是强项长程多步规划仍是 4B 的边际短板。三、4B 对 9B追赶了多少还差什么榜单之外arXiv 技术报告给出了一个更具冲击力的数字后训练把 4B 的宏平均从 58.94 提到 64.87把 9B 从 65.60 提到 69.04。关键在于——后训练的 4B64.87与 9B 基座65.60之间的差距只剩 0.73 分。技术报告原文的表述是后训练大幅缩小了 4B 后训练模型与 9B 基座模型之间的总体差距。此前头条社区亦有4B 小模型干翻 9B 通用模型的讨论其数据基础正是这条曲线。这一追赶不是凭空发生的仓库源码给出了三条支撑训练信号来自真实执行轨迹按照澎湃新闻对技术报告的报道训练语料以 OpenSquilla 等 Routing Harness 产生的执行轨迹为核心——保留能力需求预测、路由选择、模型响应、工具调用、环境反馈完整上下文并经完整性检查与目标完成、证据一致性、错误恢复等质量评估后才进入后训练。README 的 Highlights 进一步披露了数据侧的工程细节精确/近似去重、评测集去污evaluation decontamination、结构校验、六维语义评估与子场景级 Scene/Goal/Outcome 标注。这是用干活记录学干活而非背题。路由引导的课程化训练三阶段路由引导课程 SFT 路由引导 on-policy 蒸馏让模型在由简到繁的同一进度下先学格式、再学规划能力导向的分配再把评测反馈折算进下一轮训练混合比形成评估—选择—更新的原型闭环——这正是通往递归自我改进RSI的机制设计。架构上的长上下文底座config.json 中线性注意力 全注意力混合full_attention_interval4、max_position_embeddings262144、MTPmulti-token prediction一层、tie_word_embeddings配合 README.md 给出的原生 26 万 token、可扩展至 101 万 token让 4B 在长工具轨迹、多轮环境反馈场景下不至于过早中间遗忘——这也是社区文章反复提示的 4B 常见坑位之一。差距依然存在9B 后训练69.04比 4B 后训练64.87高约 4.2 分说明规模红利在同等训练路径下仍然真实而 BFCL、LiveCodeBench 等单项上 4B 对同量级对手的落后也提示 Agent 能力的纵深不能只靠一条后训练管线解决。四、『第一』头衔的含金量综合上述证据可以对开源综合评测第一给出一个不含水分、也不被过分拔高的结论含金量成立的部分在报告的 10 项基准、宏平均口径下NeoHorse-1-4B 确实是六模型第一且第一名的成色来自 Agent 执行类任务的四个单项冠军与整体均衡性而非单项爆点拉高平均4B 后训练逼近 9B 基座的事实也得到技术报告与社区实测的多重印证。评测记录完整披露了采样参数与运行次数去污流程写入 README这套口径本身是可复现、可审计的。含金量受限的部分榜单是自选基准聚焦 Agent/编码/指令遵循不含知识推理类编码与指令遵循象限仍有两到三个明显更强的单项对手BFCL 与 VitaBench 两项列第三说明第一不等于全项碾压。社区对多步规划能力偏弱的实测与榜单中复杂长程 Agent 基准的相对优势并不完全重叠——它在工具链上更强在自己想出下一步上仍受 4B 容量约束。抛开头衔本身这个模型真正值得工程侧关注的资产是Apache-2.0 许可、Safetensors/BF16 权重合计约 8.4GB分两个分片、README.md 提供的 SGLang 与 vLLM 一键部署脚本含--tool-call-parser qwen3_coder与--reasoning-parser qwen3以及社区实测中反复验证的格式合规率高、推理延迟低的部署友好性。综合评测第一决定话题热度而config.json 里那套混合注意力架构与 chat_template.jinja 里原生的思考/工具协议才决定它能不能真的在自托管 Agent 流水线里稳定产出结构化决策。榜单第一是起点而非终点Jev 综合评测验证的是4B 能把 Agent 活干到什么程度而 RSI 闭环要回答的是下一个迭代的 4B 能从这轮执行轨迹里再学走多少。成色检验的最终答案藏在这条循环的下一次迭代里。【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

论文降AI率实用指南:从检测原理到9款工具选型与改稿实操

论文降AI率实用指南:从检测原理到9款工具选型与改稿实操

论文查重过了,却被AIGC检测拦下,可能是近两年本科生最焦虑的时刻之一。你辛辛苦苦用AI辅助整理文献、润色语句,结果学校一查AI率,直接给你标了个40%,导师那边的解释还没想好措辞。我自己见过太多这种情况,也…

📅 2026/10/10 22:09:24
SpringBoot房屋租赁管理系统实战:权限控制、状态机与缓存优化

SpringBoot房屋租赁管理系统实战:权限控制、状态机与缓存优化

做房屋租赁管理系统一年多了,从最初的需求梳理到最终上线,踩过的坑、改过的代码、优化过的查询,都值得拿出来好好聊聊。这个项目用的是SpringBoot全家桶,前后端分离,前端Vue打包后放进SpringBoot的static目录统一部署&…

📅 2026/10/10 22:04:24
【 一次性搞懂Agent、大模型、API、Token、工具调用】

【 一次性搞懂Agent、大模型、API、Token、工具调用】

图解AI Agent工作链路:一次性搞懂Agent、大模型、API、Token、工具调用很多新手入门AI Agent的时候,很容易混淆一堆名词:AI Agent、大模型、API、Token、工具调用。分不清谁负责思考、谁负责调度、谁负责执行、费用怎么计算。 本文借助一张全…

📅 2026/10/10 22:04:24
MORE NEWS

更多资讯

📰

代码生成优化实战:从模板引擎到AI辅助的全链路指南

接手过遗留系统重构的人应该都有感触:真正让人头疼的往往不是手写代码,而是那些由代码生成器批量产出的“标准化”代码。它们长得一模一样、注释齐全、命名规范,但跑起来性能平平,改起来牵一发动全身。这些年我做过不少代码生成相…

📰

Oracle 异构数据迁移:从 MySQL / SQL Server 迁移到 Oracle 的完整实践指南

一、Oracle 异构数据迁移概述:理解迁移的核心挑战1.1 迁移的常见场景与目标 Oracle 异构数据迁移是指将数据从 MySQL 或 SQL Server 等非 Oracle 数据库迁移到 Oracle 数据库的过程。常见场景包括企业级应用升级、数据库平台统一、性能优化等。迁移目标通常包括数据…

📰

用户口碑佳的AI论文写作软件综合榜(2026 优选)

基于功能完整性、学术适配性、用户反馈和操作便捷性,以下是当前主流AI论文写作工具的综合测评榜单,按使用推荐指数由高至低排列,并附上各工具的核心优势与适用场景。🏆 第一梯队:全流程学术解决方案(★★★…

📰

国内高校毕业生论文季必用的AI论文写作软件是哪款?

国内高校学生在论文写作过程中,越来越依赖AI辅助工具提升效率,主流工具以本土化服务为核心,结合通用大模型与专业功能模块,覆盖选题构思、框架搭建、初稿撰写、查重降重、格式调整等关键环节,本文将深入解析当前热门工…

📰

1987年6月10日傍晚17-19点出生性格、运势和命运

傍晚十七点到十九点,恰好是落日熔金、炊烟漫过老巷屋脊的时辰。1987年芒种后第四天,江南的黄梅天还没完全铺开,风里裹着新麦的甜香,也带着夏初将至的燥意——这个时辰降生的人,骨子里总混着点麦芒似的爽利,…

📰

微服务拆分实战:从限界上下文到订单模块改造

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬