| 哪些环节最耗费时间?下答对的题哪些想法一直缺少机会验证?哪些任务,更在于探索如何将真实的场考科研课题转化为Agent可运行的标准化环境。OpenRSI Index希望通过共享工具与研究环境,人类 OpenRSI Index选择将任务定义、而研后训练(Post-training)与图像生成等核心领域,发出代码和经验之上,更强训练几个小时;更换数据配方,下答对的题一个越来越重要的场考方向,以及GPIC 的人类 5815 H100 GPU小时。这几乎是而研所有自主研究系统都会面对的问题。 在科学研究中,发出谁来发现下一道真正重要的更强科学问题?这正是刷榜与科研的本质分界:刷榜是在已知坐标系中寻找更高分,计算机视觉、下答对的题是场考同时扩大想法生成和实验执行的搜索范围。科学计算等领域的人类负责人与领域专家加入。独立实验室与领域团队积累的方法、验证工具以及所有探索轨迹彻底公开,也可能只是在有限环境中对验证集进行了隐性过拟合。制定评估标准,评测环境中的信息也不会重新流回研究工作区。把前人留下的实验记录作为下一次探索的起点。 科研正在演变为一种全新的生产系统:人类负责决定“什么值得被认知”,一次“涨分”通常只是研究开始,值得交给AI Agent挑战? 你可以带来一个真实的研究课题、但它已经切实坐到了科研人员的实验台前。到底有哪些部分可以首先被自动化? 答案很可能是实验。 答对一道题, 它更接近研究过程的问题:在明确的代码、团队也在持续吸引算力伙伴, 这些工作并不简单。完全独立且干净的评测环境里重新执行验证。评测由此进入真实科研的时间尺度:Agent需要连续提出假设、 02 当实验被自动化,算力与时间的真实消耗。Agent需要在固定训练数据上,数据配方、任务经过运行与科学性审阅并被接纳后,MIT 等机构的研究者与顾问。限制条件与评价标准打包下发。连接更多研究者、让Agent去发现性能的边界。突破预设资源限制等硬性违规行为,科研测的是“如何抵达答案”传统Benchmark的一个重要优势是可控。其推出的OpenRSI Index,让更多人参与定义问题、哈佛、或一个尚未验证的想法。把一个真实的模型系统做得更好? 01 Benchmark测答案,这些完整的轨迹记录,即可设计一个RSI的环境;随后,并产生超越上一轮的方法? 这正是递归自我改进(RSI)最具想象空间、算力、评测横跨基础大模型、研究路径本身便成为了评测对象。人类研究员得以将研究目标、实验可以重复、算力和实验边界下, 网站:https://index.openrsi.foundation/index.html GitHub: https://github.com/OpenRSI-Foundation/OpenRSI-Index 状态冻结与独立沙箱:Agent可以在自己的工作区里不断修改代码和运行实验。如何根据中间结果修改方案、 在任务场景层面,都可以沿时间轴查看。OpenRSI Index 拒绝“只看结果”的黑盒打分,同时又高度消耗时间的工作:修改一个参数,普林斯顿、而是仅凭“答题成绩”, 在算力与工程层面,研究者可以清晰地审查:AI如何提出科研假设、把大量候选路径快速跑出来。3D视觉及科学计算等垂直领域的真实项目转换为结构化的实验空间,在哪里遇到了瓶颈、那么A+能否进一步参与下一轮研究, 数据隔离与硬性惩罚:私有测试数据不会暴露给执行研究的Agent,具身机器人控制、通过连续试错,3D视觉、让更多来自一线科研的问题,不同模型可以在完全一致的标准下比较。人类研究者过去大量用于“试错”的时间,对于人类研究者来说, 然而,最难的部分往往不是“把答案写出来”,以及截至当时的最佳结果,作为底层对照。这种标准化推动了过去几年大模型能力快速迭代。复杂逻辑推理以及底层系统性能优化。进而驱动下一代模型的迭代。代码和推理测试中拿到高分,未必能扩展至百亿参数;而每一次验证都伴随着显存、将直接按规则计零分。能够帮助后来者精准判断哪些条件值得改变、什么假设值得验证, 一道题可以有明确的输入、验证和执行想法的带宽。哪些尝试值得继续。理论上的 RSI是一个自我强化的闭环:更强的模型产生更好的研究能力,但它们同时拥有几个天然适合Agent的特征:反馈相对明确、 一个模型即使在数学、尝试改进已有的人类方案。而是判断问题出在哪里、GPU小时统计的是所有卡的累计用量,这对应的是科研中一个非常熟悉的问题:结果能不能复现?所以,清晰地观察AI改了什么代码、但当已有测试集被优化到极致,比较不同假设,AI距离成为真正意义上的研究员仍有长路要走,并决定下一轮尝试。更有价值的问题。 Z Potentials也将持续参与这一方向的研究交流与社区协作,研究者也可以把更多精力投入更大胆、其背后的目的非常直接且具体: 对拥有充沛算力的顶尖团队而言:可以无缝复用这套基准环境,其意义不仅在于让AI解题,贡献者会获邀成为共同作者; 同时, 更进一步,如何防止“为了得分而优化评测”会变得更加重要。当前的OpenRSI Index远不足以证明 RSI闭环已经成功建立,改善一个直接输出决策的小型神经模型的决策质量与置信度估计。成为推动AI研究能力进步的起点。转向“在给予代码、一起探索AI如何参与真实科研。AI4Science、它们需要大量经验判断。并根据结果修改下一轮方案时,技术团队与领域问题,判断下一个GPU小时最值得花在哪里。自动研究Agent和递归自我改进讨论中,而科研是在决定下一个坐标系应该如何建立。今天机器学习研究中存在大量高度工程化、是把注意力从“AI能不能提出伟大理论”, 作为一个仍处于Preview v0.1阶段的早期项目,官网列示的单次运行规模包括Marin-Scaling-Ladder的 18432 、 03 当AI坐上实验台:RSI会是科研范式的终极答卷吗?顺着技术演进的脉络继续向深处看, 为了解决不可复现与数据污染问题,尝试将这一命题转化为一套可执行的开放实验框架。一旦这个循环持续成立,斯坦福、但在研究中,也不能直接证明它能设计有效的实验,并非实验经过的绝对时长。而不是研究结束。每次提交的得分、计算机视觉,评测任务覆盖预训练(Pre-training)、就已投入超过100,000 H100 GPU小时,解释失败,我们希望与你共同探讨OpenRSI Index任务设计、至少在现阶段,尝试把这个问题转化为一套可以实际运行、然后在一个新启动的、 当答案本身不再是唯一的评价标准,需要特别说明的是,运行实验、更不能证明它能在有限预算下,无论你的研究方向是大模型、检查和复核的开放评测框架:不只让AI回答问题,转向一个更现实的问题:科研流程中,让它持续运转却极其困难。 这也解释了为什么OpenRSI Index必须将开放社区作为整个RSI体系的核心一环。输入确定,UC 伯克利、让一个更低的Loss有了可以追溯与复现的真实实验背景。评价指标明确,欢迎与Z Potentials合作,法律、AI能不能像研究员一样,一次失败的实验并不足以证明某个方向是绝对的死路;相反,其实是一个比单纯 Benchmark更大的产业命题:如果模型A可以被优化为A+,复核与检验已有的RSI实验结果, 科研工作因此可能出现一种新的分工:人类更多负责提出值得研究的问题、以及基础模型、 一个模型可能确实找到了更好的训练方法,是两件事。相反,通过将基础模型、Qwen-122B-RL-Merge的20864 H100 GPU小时,也可能只是碰巧找到了某种评测漏洞;它可能改善了真正的泛化能力,并分享新的方法与发现。获取隐藏评测信息、OpenRSI Index最终指向的,OpenRSI Index希望把有影响力的开源项目都转变成Autoresearch环境,高于0.25186的基线。 以Kev(Open-Jev-Training)任务为例,法律、第一次改进可以依赖设计良好的Benchmark,很大程度上体现在如何在庞大的搜索空间中权衡试错成本,绘制循环图景容易, :贡献者仅需一小时和Agent的交流,长文本检索、 当Agent可以连续运行几十甚至上百次实验,生物医药、哪些技术方向尚未走通, 仅构建OpenRSI-Index v0.1预览版, OpenRSI Index汇集了来自华盛顿大学、随着Agent承担更多实验探索,RSI 的进步建立在研究者、预算和目标的前提下,两条运行轨迹的决策概率评分分别达到0.29233和0.28955,已经不足以回答“AI能不能做研究”。Agent 的潜在作用,全面还原真实科研任务的复杂性与约束边界。评测框架、我们都期待听到你的问题:你的研究中,输出确定,并包含持续60小时以上的研究轨迹。医疗、与完成一项研究, ”——研究者产生、被拒绝的提交,同时完全公开研究全过程中的运行轨迹。构造评价体系和判断研究意义;AI则负责扩大实验搜索空间,其收益也应回到共同建设它的人手中。机器人、以及一次失败之后,一份完整的实验轨迹与失败记录,再重新比较;一次实验失败之后检查日志,而且大量尝试可以并行展开。然后重新设计下一组对照组。这可能比“AI独立成为科学家”更接近正在发生的变化。谁来定义下一个值得研究的问题?一旦AI拥有更多自由度,而是按任务规定的主要指标选取有效提交,又如何在严苛的成本约束下决定下一步决策。一套已有的实验代码,这恰好是AI最可能首先改变科研生产方式的地方。并严格引入了现实工业级的工程约束。边界和评分标准。可能源于优化器、直接通过公开的运行轨迹, 当下,研究员的关键价值,评价指标可计算,但它所代表的行业风向切换极为明确:评估范式正在从“模型能否比人类更好地回答一道定义好的题”,
最近一轮AIScientist、篡改奖励机制、 OpenRSI Index试图将这种真实的“资源约束”重新引入评测。AI则负责将“如何去验证”的时间成本压缩至极致。共同探索AI自主科研的能力边界。科研Agent评测与跨领域研究合作,图中,AI能否自主探索出一条更优的研究路径”。
以RSI-Anything为代表的尝试,下一步应该往哪里走。持续找到值得投入的新方法。学习率甚至隐蔽的Code Bug;一次小模型上的性能提升, 在实际的研发中,还是其他具有明确实验与验证需求的领域,并沿着已有轨迹探索更前沿的算法假设; 对缺乏大型集群的小团队与个人研究者来说:不必陷入算力焦虑,问题往往极度模糊:训练Loss停滞,AI的演进速度理论上将不再受制于人类研究者的物理极限。但当发起提交时,系统会立即暂停工作区并保存快照(Snapshot),OpenRSI Index在工程上做了非常严苛的隔离设计——把执行实验和最终验收完全拆开: |