Bitget App
交易“智”变
快捷买币行情交易合约理财AI广场更多
英伟达震撼开源Harness!AI自己爆改AI

英伟达震撼开源Harness!AI自己爆改AI

新智元新智元2026/09/11 00:18
作者:新智元

英伟达震撼开源Harness!AI自己爆改AI image 0

  新智元报道  

英伟达震撼开源Harness!AI自己爆改AI image 1


OpenAI之后,老黄也出手了!

终于,英伟达重磅开源了自家的Harness——SoL-Pi。

它把Pi作为底盘,基于此重造了一套Harness效率增强层,让AI实现自我迭代、优化。

英伟达震撼开源Harness!AI自己爆改AI image 2

在这套严苛的自动化流水线中,AI自己也当上了研究员。

它们观察Agent怎么干活,找出哪些步骤在白白烧Token,提出方案、修改bug,再把方案送进测试。

AI的整个搜索从152个候选方向开始,最终留下了四大杀手级架构机制。

实测结果,令人咋舌——

Token消耗最高省64%,API调用成本骤降50%-54%。


英伟达震撼开源Harness!AI自己爆改AI image 3

在专业的研究场景下,每小时可直接省下8.75美元至13.5美元。英伟达,把AI省钱的开关开源了。

配置非常简单,仅需一行代码:「pi install git:github.com/NVlabs/SoL-Pi」,即可装到现有的Pi上。


英伟达震撼开源Harness!AI自己爆改AI image 4
Codex狂飙代码
一半Token却在空转


在让AI递归改进自己之前,能不能先让它把自我改进的账单打下来?

Harness,模型干活时使用的整套运行框架,是当下最好的解。

模型负责推理,Harness负责把工具、上下文、执行反馈和任务流程组织起来,让模型能够读文件、改代码、跑测试,并根据结果继续行动。

同一个模型,放进不同的Harness里,做事效率可能差出一截。

英伟达震撼开源Harness!AI自己爆改AI image 5

当前的问题在于,编程智能体的任务越来越长。

从补几行代码,到跨仓库修复问题,再到长时间自主工作,单次任务可以持续数小时。

这时候,一些平时不起眼的Token浪费,会不断累积。

改完文件,明明下一步就是跑测试,模型还要再推理一轮。一个大文件早已读过,后续请求仍在反复携带它。

几千行日志里,真正影响决策的可能只有几行,昂贵的模型却要从头读起。

英伟达震撼开源Harness!AI自己爆改AI image 6

递归自我改进(RSI),同样绕不开这笔开销。AI每尝试改进一次系统,都要花Token。失败的方案,也照样收费。

SoL-Pi的出现,要解决的就是这件事。

最终结果显示,和底座Pi相比,SoL-Pi少用45%到49%的token,成本低大约三分之一,平均得分保留94%左右。

和Codex、Claude Code原配的harness相比,token少35%到64%,标价成本低50%到54%。

英伟达震撼开源Harness!AI自己爆改AI image 7

这么惊艳的表现,SoL-Pi是如何做到的?这就不得不详细拆解下,它的核心四大机制了。


英伟达震撼开源Harness!AI自己爆改AI image 8
AI卷自己进化,四个大招来了


英伟达的流水线最终留下了四个机制,刀刀避开主干,专治重复劳动。

第一层:动作融合,一次调用完成编辑与验证

Action Fusion直击的是两次工具调用之间,那段多余的模型决策环节。

在基础Pi的运行轨迹里,最常见的序列是修改文件、收到结果,然后再调用命令去测试或者构建。

既然后续命令已经非常明确,中间这轮模型的「一来一回」就有了极大的压缩空间。

英伟达震撼开源Harness!AI自己爆改AI image 9

动作融合将一次编辑及其后续命令保留在一个本地序列中,省去了中间的模型决策环节

Action Fusion直接把编辑和后续命令封装进同一个本地执行序列。

Harness在底层完成修改、运行命令,再把合并后的结果一次性返回。测试照常执行,结果正常获取,但中间那轮模型请求被成功省去。

这相当于把两次分散的请求,合并为了一次高效的闭环操作。

第二层:在线上下文压缩,按子任务动态核算成本

Online Context Compact,解决的是「何时触发压缩」这一核心痛点。

上下文越长,历史材料越容易变成算力与资金负担。

但压缩也是有代价的:重写上下文可能会打断已有的KV-cache复用,需要重新支付处理成本。

因此过早压缩未必省钱,过去的策略往往是把压缩动作尽量推迟。

英伟达震撼开源Harness!AI自己爆改AI image 10

在线上下文压缩将已完成的子任务视为潜在的压缩点,然后等待后续请求能够偿还重写成本时再执行

SoL-Pi重构了判断时机,它把大任务拆分为子任务,每完成一步,就重新进行评估。

其核心逻辑在于精准计算:只有当「未来预计省下的开销」能够覆盖「本次重写的成本」时,系统才会真正执行压缩操作。

第三层:输出归档与索引,大块文件按需召回

ObservationPack,专门处理大段工具输出造成的「重复计费」问题。

一个大文件或一份超长结果,首次读取后如果一直滞留在上下文里,后续每一轮请求都会原样携带它,持续消耗缓存资源。

英伟达震撼开源Harness!AI自己爆改AI image 11

ObservationPack用稳定的句柄取代了重复的完整输出,同时保留原始内容以便分页召回

SoL-Pi的做法是把完整内容直接归档到本地磁盘,上下文里只留一个稳定的短句柄和一小段摘录。

这就像读完长篇报告后,直接把原件存档,手边只留索引和关键摘要。模型需要查阅细节时,直接根据索引按页取回即可。

第四层:小模型初筛日志,引入严格的证据核验机制

Evidence-Preserving Reducer的核心,是把长日志的第一遍阅读委派给成本更低的模型。

构建和测试日志动辄上万字,真正影响下一步决策的往往只有几行报错。让前沿大模型每次通读全文成本极高;可直接交给小模型去总结,又容易引入幻觉。

英伟达震撼开源Harness!AI自己爆改AI image 12

证据保留归约器仅在可对照存档日志核验其证据时,才接受紧凑的诊断回执

SoL-Pi在中间加了一道严格的防线——证据核验。辅助模型读完日志后,必须输出一份紧凑的诊断回执。

系统会拿着这份回执,逐条与归档的原始日志进行比对。只有严丝合缝对得上的原文,才会被放行交给前沿大模型。

这确保了主模型只接收被证实的信息,从源头上切断了误差传导。

英伟达震撼开源Harness!AI自己爆改AI image 13

152个点子厮杀,只留下4个


为什么是这4个机制?这就得说到英伟达真正的野心,RSI(递归自我改进)。

既然AI能改代码,也应该能改造「生产AI的系统」。

但RSI太烧钱,每一次试错都要付token费。于是英伟达换了个目标——先别急着让AI更聪明,先让它更省钱。

相比直接追分,token效率更难作弊。刷任务分数很容易过拟合,给特定题目写规则就行;但删重复上下文、压缩工具输出、合并无效决策,这些优化能迁移到不同任务和模型。

于是,一条「Agent研究Agent」的流水线启动了:

团队先搭出535个可验证环境,再让AI提出152个优化方向,随后经过三轮筛选——

先用历史轨迹估算收益,没潜力的直接淘汰;再让AI自己改代码、跑实验,并由Reviewer Agent挑刺;

最后冻结方案,在完全隔离的held-out任务上验真,能力不能掉,效率必须涨。

英伟达震撼开源Harness!AI自己爆改AI image 14

152个想法,最终只活下来4个,平均约40个才能出1个。

于是SoL-Pi的核心方法也逐渐清晰:让AI大量提出假设,再自动实验、淘汰、验证,把真正有效的少数机制筛出来。


英伟达震撼开源Harness!AI自己爆改AI image 15
让RSI飞轮,自己转起来


SoL-Pi背后,是MIT副教授、英伟达研究总监韩松掌舵的Efficient AI团队。

对他们来说,SoL-Pi当前省下了多少token开销,不过是一个阶段性注脚。

他们真正看重的,是这条「AI研究AI」的飞轮还能转多大。

在官方项目的主页中,团队还埋下了两个极具野心的长线伏笔:

一个是「闭环预训练」(Pretraining the harness)。

目前的535个环境依然是人工构建的,未来将由Agent自己去全网收集任务、搭环境、验证、更新自己的harness。

算力和环境多样性一旦拉升,harness很可能也会跑出属于自己的Scaling Law。

英伟达震撼开源Harness!AI自己爆改AI image 16

另一个是「效率复利」(Efficiency for efficiency)。

用变省了的harness,去跑规模更大、成本更低的自动研究循环,进而找出更高效的机制,形成成本压缩的复利效应。

在这个飞轮里,人只负责在初期提供先验方向;一旦进入循环,从研究到验证全程零干预;等AI把机制跑通了,人再回来搞清楚AI到底发现了什么,并将机器生成的粗糙代码重构成符合工业标准的版本。

现在,模型的Scaling Law各家还在争论不休;但Harness的Scaling Law,已经有人开始抢跑了。

而那个在赛道上狂奔的,是AI自己。

编辑:桃子 摩西


秒追ASI
点赞、转发、在看一键三连
点亮星标,锁定新智元极速推送!

英伟达震撼开源Harness!AI自己爆改AI image 17

英伟达震撼开源Harness!AI自己爆改AI image 18

0
0

免责声明:文章中的所有内容仅代表作者的观点,与本平台无关。用户不应以本文作为投资决策的参考。

你已了解市场,是时候开始交易了!
Bitget支持一站式交易加密货币、股票和黄金等。
立即交易!

你也可能喜欢

“新美联储通讯社”:美联储下周势将加息,但只加息一次无法解决问题

“新美联储通讯社”Nick Timiraos最新撰文称,投资者已基本认定美联储下周将进行三年来首次加息,更难的问题是之后会怎样。由于美联储内部几乎没人认为单次加息25个基点足以压低通胀,若下周决定加息,则反映的是利率此前处于错误水平的判断,一次加息无法解决问题。自1990年代以来,美联储仅有一次“一次性”加息。

华尔街见闻2026/09/11 20:58

WTI原油净多头创20周新高之际,特朗普政府酝酿动用《国防生产法》扩炼油产能

炼油企业高管表示,新建炼厂需要数年才能投用,倾向提高现有炼厂效率。目前美国柴油平均价格首次突破每加仑6美元,汽油价格居高不下,炼厂开工率已经达到约98%。据CFTC数据,截至9月8日当周,NYMEX WTI原油净多头头寸创20周新高,汽油净多头创9个月新高。

华尔街见闻2026/09/11 20:45

CPI后投行纷纷“撕报告”:年内不加息阵营“投降”,鹰派押注到明年1月加三次

道明证券预测转向最鹰,从预计全年利率不变改为到明年1月共加息三次。摩根大通改为预计9月、12月各加一次,10月暂缓。三菱日联预计9月加息后暂缓,12月再加息概率最高60%。花旗:9月加息后一直按兵不动,明年6月重新降息。

华尔街见闻2026/09/11 20:38

67%暴跌后卷土重来!AI投资明星Aschenbrenner重回市场,押注SK海力士、AMD等

据媒体报道,Leopold Aschenbrenner旗下对冲基金Situational Awareness重返期权市场,已购入数亿美元期权,涉及SK海力士、闪迪、超威半导体、Bloom Energy以及甲骨文等标的。此次建仓策略转向低杠杆,采用定制化期权工具,最大损失仅限已支付的期权费。

华尔街见闻2026/09/11 20:19