让AI自主推进一项研究: 华为诺亚方舟实验室发布ScienceFlow
2026-08-05

24小时机器学习研发,到近10天组合优化搜索,探索长程科研智能体

给出一套清晰的固定流程,Agent执行起来并不难,可一旦涉及回头探索与自主纠偏Agent往往就卡住了——而这,恰恰是它难以自主推进一项研究的关键瓶颈。科学研究从来不是一条从起点直达终点的直线。

ScienceFlow的思路,是让研究形成一个能自我运转的闭环:执行验证保存转向它给 Agent 配备了一个随时可存档、可回滚的科研工作区Agent不再只是死板地单向往前冲,而是能根据验证结果自主决策:是继续深入,还是退回某个历史步骤、重新换条路走。

ScienceFlow:让Agent重新思考

ScienceFlow 是华为诺亚方舟实验室打造的长程科研智能体系统,专为机器学习研究、科学建模与数学优化等长程任务而生。它最大的突破,在于赋予了 Agent “第一人称视角的主动探索能力,真正像一个人类科学家一样去思考和实验:

能随时存档与回退阶段性备份完整工作状态,支持研究成果的继续、重来或分叉探索。

能自己看懂中间信号在实验推进中实时评估价值,发现路线不对立马止损。

能有理有据地调头结合前期反馈,自主决定是继续深挖,还是退回历史节点重新出发。

能从错误中总结经验将所有成败记录转化为经验资产,并通过巧妙的经验折叠,既不挤爆上下文,又能让后续研究越做越聪明。

不只是循环执行:自主推进可恢复的研究过程

ScienceFlow如何自主推进研究路线:ScienceFlow不只依赖文本上下文记录研究进展,而是将代码、数据、模型与验证证据阶段化备份,形成可恢复的真实研究状态。Agent依据实验反馈自主决定继续当前路线、从历史阶段恢复,或切换探索方向。研究路线在执行中逐步形成,而非由高层规划器预先设计。

差异不只在搜索策略,更在搜索对象与状态载体:Agent Loop沿当前交互轨迹持续执行,MCTS搜索状态动作树,AlphaEvolve进化候选程序种群,MCTS搜索状态—动作树,Agent Loop沿当前交互轨迹持续执行;ScienceFlow则探索由阶段化工作间承载的可恢复研究状态,使研究路线在 Agent 与真实实验环境的持续交互中逐步形成。

OpenAI MLEBench权威榜单登顶!

OpenAI2024年提出MLE-Bench通过75项真实机器学习竞赛任务,评估Agent从数据理解、实验设计到模型训练和结果迭代的完整研发能力,陆续有知名公司和学术机构(谷歌,微软,百度等)积极参与设计和方案比拼。

ScienceFlow使用开源模型DeepSeek-V4-Flash作为底座,在每项任务24小时预算内,三次独立运行的综合Any-Medal率达到70.22 ± 1.18%,位列当前排行榜第一。这一结果表明,长程状态管理和过程经验驱动的自主研究方法,在不额外增加外界知识情况下,是可以在多类型机器学习任务中稳定转化为最终成绩,总成本:65.5美金。

一个具体案例:从历史状态恢复并探索新路线

自主搜索与在线反馈:ScienceFlow24小时双 Worker并行探索,以 Validation 为搜索反馈,自主探索 CNN、特征工程、树模型与集成路线,Validation0.1100持续优化至0.0597。系统的价值判断同时保留关键 GPU 训练、终止低效任务,并将部分工作切换为轻量推理。

状态恢复与资产复用:Agent可以返回历史 Workspace,在保留代码、checkpointOOF预测和特征资产的基础上创建新研究分支。S59复用早期 CNN checkpointS112S123进一步重组 OOF、角度特征、LightGBM与宽网络 logits。历史 Workspace由此成为可恢复、可复用的研究节点,并最终形成奖牌级方案。

关键优势:ScienceFlow将长程优化从线性的反复试错,转化为能够保存、回退、复用和重新组合历史成果的分支式自主搜索,在减少重复训练的同时,持续扩大有效方案空间。

10天自主探索:组合优化任务斩获铜牌!

如果24小时考验的是Agent能否完成一项完整机器学习研发任务,那么连续近10天的组合优化性能挑战,考验的就是系统能否保持长期稳定运行。

GECCO 2026 SpOC 4Keplerian Tomato Traveling Salesperson Large赛题中,面对复杂约束和大规模解空间,ScienceFlow系统持续生成候选方案、评估任务指标并保存当前结果,最终优化至393.229(越低越好),在Large榜单中获得铜牌全程没有人工注入额外知识,最终总成本:23.34美金。这项结果的意义不只在于一次排名,证明了ScienceFlow可以在跨越多天的搜索过程中保持研究状态,根据反馈持续调整研究路线,并把阶段性进展沉淀为可恢复的工作成果。

不止机器学习:从科学建模走向数学优化

长周期科研智能体的价值,不应局限在单一基准或单一任务类型。ScienceFlow进一步在科学建模和数学优化场景中进行了验证。

Sci Modeling Bench覆盖8个任务组、13项科学设计优化任务。在统一使用DeepSeek-V4-Flash并采用pass@1评测设置的条件下,ScienceFlow取得54.41All Score。对比业界常用的Harness包括Claude CodeCodexOpenCodePi。这些任务涉及候选设计、材料与生物分子等不同搜索对象,要求Agent在多轮实验反馈中不断发现更优方案。

Fourier uncertainty数学优化任务中,ScienceFlow结合OpenPangu,在Hermite多项式设定下,C4上界推进到0.342293122432,并通过公开验证器复核。这里重要的不只是生成一个候选答案,而是让候选构造、计算实验和严格验证形成完整闭环。

AI助手,走向长期研究伙伴

今天的大模型已经越来越擅长回答复杂问题,但真正的科研与工程价值,往往来自对同一个目标持续投入、反复试验,并在失败之后找到新的方向。

ScienceFlow所探索的,是从“固定流程”到“自主研究”的跨越:让AI Agent自主推进长期搜索闭环,积累包括成功与失败在内的经验资产,并以经验折叠控制上下文规模,在资源约束下持续寻找更好的结果。

ScienceFlow目前处于研究预览阶段,代码与技术报告预计于20268月初开源。未来,团队将继续推进其在机器学习、科学计算、组合优化等Agent长程优化相关方向的研究与验证。

 

上一篇:大模型驱动的MIP求解器智能调优新范式
下一篇:
NOAH'S ARK LAB
Noah_ark_lab
noahlab1@huawei.com
关于华为
加入我们
合作生态
联系我们
版权所有 © 华为技术有限公司 1998-2026。保留一切权利。 | 法律声明