
你有没有想过一个人要怎么才能真正变强光靠死记硬背不行。刷题刷到天亮也不行——因为题库总有做完的一天。真正让人越来越厉害的是这种能力自己给自己出题自己判断这道题我还不会然后拼命去搞定它。这是人类学习的终极形态。而就在最近一个叫Ornith-1.5的开源AI把这件事第一次做到了。01这个 AI 在干什么PART 当你上班的时候.想象一下这个场景一个AI模型在独自工作。没有人给它布置任务没有人告诉它今天该学什么。它先问自己我现在哪里最弱然后它自己生成一道刚好卡在自己能力边界上的题目——不太难不太简单就是那种做三次大概能成功一次的难度。接着它自己设计一套测试规则来评分。最后它真的去解这道题把解题过程喂给自己当训练数据。这整个过程循环往复。没有人工干预没有人工标注没有人给它说这道题你做对了——它自己判断。这就是 Ornith-1.5 正在做的事情他们把它叫做自我改进循环self-improvement loop。02这个 AI 让人背脊发凉PART 打败Claude先说一个具体的数字Ornith-1.5 最大的版本397B参数在一个衡量AI能不能真正帮程序员写代码、调bug、完成真实工程任务的测试上SWE-bench Verified得分86分。Claude Opus 4.8是 Anthropic 目前最强的闭源商业模型得分是85.8分。这意味着什么意味着一个完全开源、可以自己下载运行的模型在真实编程能力上已经追平了当今世界最贵、最强的商业AI之一。而且这还只是开始。03这个 AI 给自己出题PART 可自我进化的 AI这里有个很反直觉的地方。很多人以为让AI变强就是喂给它更多数据。但数据终有穷尽——互联网上有价值的代码、论文、解题过程早就被各大模型训练过一遍了。Ornith团队想到的突破口是不依赖外部数据而是让模型自己制造训练数据。但这里有一个隐患模型如果随便出题可能会专门出自己会做的简单题那没意义也可能出根本无法解答的怪题也没意义。所以他们设计了一套精妙的奖励机制来管住这件事——出的题必须有效可验证能判断对错、必须难度刚好在能力边缘大约五次里成功一次还必须足够新颖不能反复出同一类题。三个条件同时满足才给高分。这像不像你当年最好的老师的出题逻辑还有一件更离谱的事Ornith-1.5 还有个 9B 的小版本约 1.5GB。9B是什么概念大概是目前旗舰版模型参数量的 1/44。手机能跑的那种。就是这个手机版在编程能力测试上的得分超过了 Google 的 Gemma 4-31B——一个参数量比它大三倍以上的模型。04AI 开源追上闭源模型PART 可自我进化的 AI也许你不是AI研究员也不会去自己下载运行这些模型。但这件事的意义远不止在技术圈内。第一层影响你用的编程工具会更强。Cursor、GitHub Copilot、各种代码补全工具背后的模型会越来越多地用上类似这种自我进化的技术。你未来写代码、做数据分析这些工具会更懂你。第二层影响开源正在追上闭源。过去两年ChatGPT、Claude、Gemini这些闭源模型遥遥领先开源模型只能追着跑。但 Ornith-1.5 这类工作在说这个差距正在快速收窄而且拐点也许已经到来。第三层影响AI进化的逻辑变了。以前AI变强靠的是更多数据 更大算力 更多标注人员。Ornith-1.5 证明了一条新路自己出题、自己刷题、自己变强。这条路不需要无限的人工投入只要运行就行。你有没有那种感觉——某个东西突然开始会自己学习了05AI总结PART 开源还是闭源Ornith-1.5 是完全开源的代码和权重都可以下载。在AI领域开源追平闭源本身就是一件会被反复载入史册的大事。但更让人细思极恐的是这件事背后的逻辑转变以前AI越强需要的人工越多。而 Ornith-1.5 在说也许从现在开始AI越强它自己就能学得越快需要的人工反而越少。这个循环一旦开始很难停下来。06开源模型技术附录PART 技术核心要点三阶段训练循环缺一不可Ornith-1.5 的自我改进循环由三个阶段串联组成每一轮迭代都同时训练这三件事第一阶段Task Proposer任务生成器给定一个代码库或运行环境模型查阅自己过去的任务解决记录然后提出一批新任务。这批任务要求比已经解决过的稍难一点专门针对当前的能力盲区。第二阶段Harness Generator评测脚手架生成器对每道新任务模型自动生成一套裁判规则——包括任务说明、可调用的工具列表、评分逻辑。这个 harness 本身也被打分标准是规则清晰、打分忠实、难以被钻空子。第三阶段Solution Rollout解题执行模型真正去解这道题执行过程中产生的轨迹rollout被用来计算强化学习的奖励。好的轨迹反向更新三个阶段的参数——任务怎么出、规则怎么写、解题怎么做三者一起优化。整个过程用的是GRPOGroup Relative Policy Optimization这是 DeepSeek-R1 带火的强化学习算法比传统 PPO 显著降低显存需求更适合大规模训练。任务奖励函数的设计细节任务奖励 R_task 是三项的乘积..json{R_task V(q, s) × D(q, s, {τ}) × N(q)}V有效性。脚手架能否正常运行正确答案是否通过明显错误答案是否被拦截任何一条为零整个任务奖励归零。这是一个硬门槛防止无效题混入训练。D前沿难度。对同一道题采样 N 条解题轨迹统计成功率 p。目标成功率 p* 设为 0.2即五次里成功一次用高斯函数度量偏差..json{D exp(-(p - p*)² / 2σ²)}随着模型变强同一道题的 p 上升D 值自然下降推动生成器去出更难的题——这就是课程自动进化的核心机制。N新颖度。与历史任务缓冲区里所有任务计算相似度取最高值后用 1 减去确保不重复刷同类题。新颖度的权重刻意低于前两项避免模型追求奇怪而忽略有用。评测脚手架的防作弊设计这是整个框架最容易被忽视、但至关重要的一环。如果裁判规则本身可以被钻空子模型就会学会走捷径而不是真正解题——AI领域把这个问题叫做reward hacking奖励函数被破解。Ornith 的评测设计做了几件具体的事来防止这种情况SWE-bench 类任务中本地仓库的 Git 历史被完整删除防止模型通过查历史 commit 或 diff 来直接找到答案禁用网络访问防止模型联网搜索解决方案NL2Repo 任务中封锁指定 GitHub 仓库和 pip 包的访问防止直接复制已有实现这些反作弊设计让评分数字的含金量大幅提升。07三个版本模型参数对比PART 不同版本定位差异规模版本的定位差异Ornith-1.5-397BMoE激活参数约 ~50B旗舰版对标 Claude Opus 4.8。Terminal-Bench 2.1 得 86.1Claude 是 85.0SWE-bench Verified 得 86Claude 是 85.8。在 WideSearch深度网页搜索推理和 BrowseComp多步网页检索上反超 Claude说明长上下文的 agentic 推理能力尤为突出。Ornith-1.5-35BMoE激活参数仅 3B/token每次推理只激活 3B 参数但整体表现大幅超过 Gemma 4-31B 和 Meta Muse Glimmer-30B 这类密集型模型。Terminal-Bench 2.1 得 68.5 vs 43.4GemmaSWE-bench Verified 得 79 vs 52Gemma。这说明 MoE 架构在推理成本和能力之间的权衡已经进入一个质变区间。Ornith-1.5-9BDense附带量化手机版最值得关注的可能是这个。9B 参数的密集模型SWE-bench Verified 得 70.6比 Gemma 4-31B52和 Qwen 3.5-9B53.2都高出一大截。量化版可以直接跑在 iPhone 和 Android 设备上意味着本地化的代码 Agent 在端侧真正成为可能。08模型基座的选择PART 模型基座Ornith-1.5 在 Ornith-1.0 基础上扩展后者以Qwen 3.5和Gemma 4为基础经过继续预训练CPT、中期训练mid-training和后训练post-training三阶段处理。Ornith-1.5 则在此之上用上文描述的自我改进循环做了进一步的强化学习迭代。这意味着 Ornith 并不是从零训练一个基座而是在成熟开源基座上做能力上限的突破——路线选择本身就说明了团队对数据墙的判断预训练数据的边际收益已经在递减强化学习阶段的自我改进才是下一步增益的主战场。更多transformerVITswin tranformer 参考头条号人工智能研究所 v号人工智能研究Suo, 启示AI科技动画详解transformer 在线视频教程