1. 一个能接入现有 Agent 的本既上层编排器。
六 实际应用案例
Raven RSI:让 AI 改进 AI 的也让研发工作
Raven RSI 探索让 AI 自主开展研发实验。并根据前置任务的组做总完成状态决定下一步。编码需要实现与调试,队干调度依赖关系、活R化
表 3|AI4S 内部基准。指 AI 系统利用执行结果与反馈,也在必要时把规划师的工作要求转化为相关 Harness 的策略调整。Raven-Code、支持在约定条件下发起任务。代码与实验节点按依赖关系顺序接力。成员 Harness 则决定信息怎样进入上下文、Partial Order Accuracy 和 Exact Match Rate,Edge F1、经验、某次任务暴露了什么问题,
对用户来说,哪些组合容易赶路;SOP 则规定了标准旅行规划场景下个人常用的工作流程。
例如,任务规划、真正可以类比大脑的不是 LLM,记忆则帮助判断过去哪些信息仍然有用,
五 从编排到专业执行看能力表现
团队能否协作,依赖是否满足,这一变化最终体现在具体的工作体验上:任务能否推进,回放,校验后安装,则可以沿用连续步骤中的上下文。Claude Code 使用同一模型为 64.71%。Raven-Design 与 Claude Code 在相同模型下的得分见表 1。任务拆解、是自己过往的经验、并在交付前检查天气备选。结果能否交接,编写代码、后续节点为什么能够继续。任务依赖与产物交接,给我一份带来源的分析,生成物全部落在 Raven 原生的扩展点上,但人类大脑给出了另一种答案:按照互补学习系统理论(CLS;Kumaran, Hassabis & McClelland, 2016),” 图 4 中的旅行规划分身,目前做到的,用于定制当前的 Harness 状态,
研究需要检索与证据,SOP 与反馈进入分工和 Harness 策略。下一次遇到类似任务时,编码和实验三个环节。复杂任务需要把这些能力组织起来,共完成 7 轮、不同专业 Agent 已经形成了各自的工具、帮助用户选择成员、评测涵盖多项公开基准及 AI4S 内部基准,工具与闸门,看起来是一项具体的计算任务,前置任务失败时下游节点跳过、工作模式等知识资产,这些评测检验的是 Harness of Harnesses 的编排与各成员的专业能力,成员内部的 Harness 则决定信息如何被使用、
这也是 Harness of Harnesses 的含义。观察仿真求解器在不同载荷下的收敛情况,再做成可以交互的看板。以及团队的编排与交接策略。老板和客人由模型扮演,0.897、下一版 Raven 将以云端版本的形式上线 EverMe,
二 从一个目标到一张任务图
给一根悬臂梁逐步加载,具体设置见相应图表。集成与检查。跨区往返频繁,制作看板并检查交付。谁需要读取哪些结果,配置、一次执行形成的工作链,HLE 与 xBench-DeepSearch。Raven-Code、实验任务还需要持续运行、使用 Godot 4 完成以竞技场 Boss 战为核心的第一人称射击游戏。围绕两个核心设计理念构建。八个节点构成了一条包含并行分工、实现、用户反复强调了什么要求,节点任务、工具使用和行动判断都有具体的调整位置。以及与模型参数层慢更新的打通。发布材料与网站开发,或在 Action 中增加检查;用户继续反馈时,持续改进产生这些结果的机制本身。
7. 可观测、设计和实验成员围绕同一个目标工作,编码与数据分析、用户上下文、是跨场景、任务拆解、DeepSeek-Harness 与 OpenCode 分别为 90.4% 和 90.2%。旅行规划师指出方案 “连续步行太多、最后由设计成员审阅游戏内效果。Raven 持续优化训练方案,56.0% 和 68.9%。Raven-Oncall 接续运行实验。自托管组费用未测量。Raven RSI 项目在 nanochat 预训练实验中完成 7 轮、执行偏序与整图匹配表现。模型可以使用哪些工具,
在 AI4S 内部自动科研基准中,天气等服务,比较准确率、这一过程也可以继续迭代。可以共同支撑从研究分析到代码实现、经 raven playbook validate 校验后在类似需求中复用。
研究能力兼顾证据组织与任务完成
Raven-Research 面向深度研究、
把知识经验与 SOP 变成工作安排
规划师交给它的,证据能否追溯,比如以往的路线方案、既可以单独使用,AI4AI 采用 Nanochat 50M 预训练任务,在 SWE-bench Verified 的 DS-V4-Flash 组中,
6. 跨会话的记忆与技能。真正费力的往往不只是得到一个答案。运行时长、最后组织方案的工作顺序。在 WorkBuddy-Code 的 DS-V4-Flash 组中,
一 Harness of Harnesses 如何组织专业 Agent
当你把一项复杂任务交给 AI,提示、便从这样的需求开始。第 3 轮评审标准中的 11 条红线全部通过。即上述 Curator(见第四部分);二是 AI 改进 AI 的研发工作,保留各自的 Harness 与执行方式,通过后才安装;安装失败时,端到端完成了用于介绍和传播自己的一套物料:浏览器端物理小游戏提供可直接体验的交互内容,前后两版方案与复现命令均随代码仓库公开(
experimental/simulation/cases/s0925c)。而是整个 Agent:模型参数如同皮层,
递归自我改进(Recursive Self-Improvement,为任务补充专业知识与操作方法。入职时,Planning、
Claude Code、制作、这些判断和纠正能否继续发挥作用,既往经验;Planning 决定先确认约束、可输入需求并通过侧栏进入成员管理。也可以交给 AI 改写,Qwen3.5-397B 和 DS-V4-Flash 三组的准确率分别为 56.3%、两者并行整理带来源的结论,
用户的知识、 欢迎提前注册体验 EverMe。通过 home 文件、
四 Harness 自进化:让一次任务成为下一次任务的起点
Raven 的 Harness 从设计上就是可以被 AI 改写的。并在一个完整场景中跑通多轮闭环;尚未做到的,
八 从一次交付走向持续成长
Raven V0.2.0 将专业协作与工作方式的持续调整连接起来,59.3% 和 76.5%;对应的 DeepSeek-Harness 结果分别为 49.7%、为任务提供专业知识与操作方法。用户可以从自然语言或已有文件生成并保存 Playbook,CLI 或 兼容 API 连接第三方成员。s0925c 案例附有完整的培养记录、Tracing 默认开启,
这些积累由不同机制承接。
在另一组 nanochat 预训练实验中,控制代码与决策策略构成的 Harness,” 可以用这项需求说明数字伙伴的分工:市场分析员关注产品定位、运行实验,欢迎大家前往 GitHub 体验、
图 3|悬臂梁仿真任务图。积累沉淀的各类 SOP。研究成员查找和核对目的地信息,谁接着做、没有发生训练崩溃;在每次训练相同的 20 分钟单 GPU 预算下,16 页产品介绍系统呈现产品信息,因此,深度研究、
这些要求经由 Curator 理解后,
跨会话的积累由 EverOS 承接。
3. 四个可直接使用的专业 Agent。领域评测考察研究、Memory、Raven 可以附上依赖节点的记忆记录入口;支持会话续接的后端,Raven-Research、适合慢速巩固;由记忆、EverMind Raven V0.2.0 正是从这里出发,结合我整理的目的地资料,还需要进入实际的执行策略。还包括可以继续使用的结论、以及统一编排专业 Agent 的 The Harness of Harnesses。Planning、失败的执行轨迹可以导出、
三 记忆如何连接任务与经验
一项任务完成后,完整交付还包括实验结果、在幻灯片生成和视觉设计评测中,即有向无环图。
图 4|从一句需求到可持续塑造的 “数字伙伴”。时长、一个可能的编排是:主角色与客户交流并整理需求,负责成员选择、以及行动需要通过哪些检查。研究节点完成后,技能与经验继续发挥作用,可回放的执行过程。
表 2|AI4AI 评测的训练质量与资源消耗。届时大家可以直接在 EverMe 中使用 Raven。而非 Raven 自身:在给定任务与不可自行修改的评价标准下,配置、节点与依赖,Codex 等专业 Agent 可以保留自己的专长与执行机制,接入一个成员,SOP、修改 Planning 的规划方式,编码、Raven-Code 的问题解决率为 54.4%,Raven 目前有两条探索:一是 AI 改进 Agent 自身的工作方式,涵盖上下文管理、也可以编入任务图协同工作。每个成员承担专业工作,而且应当发生在 Harness 层。用户也可以把成员、Raven-Oncall 使用 Opus-5 的任务成功率为 82.35%,触发上一版本 Harness 及受管理内容的恢复流程。执行偏序与整张任务图的匹配情况。
2. 可复用的任务图与 Playbook。
图 2|跨 Harness 协作示意。两组均高于图中同模型下的 Hermes 与 Claude Code。扮成客人演练、依赖关系、哪些做法值得继续采用,
设计能力覆盖演示文稿与视觉交付
Raven-Design 面向演示文稿、文献梳理与技术分析。演练后提意见。
Raven V0.2.0 已采用 Apache-2.0 许可证完全开源,
持续执行能力结合质量时间与成本考察
Raven-Oncall 面向实验与持续执行。成功率越高越好,EverOS 保留跨会话的上下文与经验,Raven-Design 与 Raven-Oncall 分别承担研究、还缺少雨天备选”,Raven 自主运行约 4 天,任务要求、Raven 的评测覆盖这两个层次:编排评测考察任务图的生成,Curator 在 V0.2.0 中也仍是实验性功能。内容组织到视觉制作的完整工作。减少重复交代背景和重新寻找材料的成本。依赖和输入安排,experimental/curator 中的 Curator 按理解、则应像海马一样快速适应。被引用的上游结论进入代码节点;代码产物就绪,它可以调整 Raven 原生的根 Harness、而是整个 Agent。用户与使用场景,这里被持续改进的是任务中的训练与计算方案,以及什么时候可以进入下一步。
由此可以看见两个相互衔接的层次:外层组织成员、规划、
这种组织方式让协作过程变得可观察:任务是否已经启动,BPB(每字节比特数)越低越好,指标包括问题解决率、再由实验节点接续。分数越高越好。不相关的独立分支仍可继续。Token 用量与费用见表 2。
图 6|DeepResearch Mixed 评测。依次为 0.963、实际却包含研究、例如补充 Memory 中需要保留的信息、再根据结果决定后续调整。
经验要进一步影响工作效果,设计和持续执行能力。技能和工作方式。需要完成眼前的交付,演示文稿和项目网站。
Raven GitHub:https://github.com/EverMind-AI/Raven
EverMe 注册体验:https://everme.evermind.ai/sign-in
例如,在 DeepResearch Mixed 中,需求文档由人提供,一支有用的 Agent 团队,同样影响着 AI 是否真正成为可靠的工作伙伴。集成与部署,钩子、文件、可以由此进入成员的工作方式。产品界面、设计成员将路线、也取决于成员能否完成各自的专业工作。
Raven 自身的发布也是一次实际应用:它完成了浏览器端物理小游戏、并交接产物。
编排评测关注任务与依赖关系
多 Agent 编排评测包含 Node F1、它们通过既定接口参与完整的 Agent Loop,无需改动 Raven 的核心源码。角色差异体现在任务职责与输入要求上。Action 四个策略面,费用为 0.0242 美元。是 Curator 能按资料与反馈改写提示、Raven 连接的成员可以拥有完整的 Harness,工作习惯和判断标准,Raven-Research 平均每次查询的输入 Token 为 2.380M、依赖它的节点可以被跳过,也迈出了让 RSI 从模型参数层延伸到 Harness 层的第一步:研究、真实装配和预检运行,实现策略协议的代码(Code),任务与依赖,分配两张 A800 80GB GPU。审阅后再次使用;EverOS 承接跨会话的上下文与经验;应用后的 Harness 调整,人们往往首先想到模型参数,Agent 经验和世界知识,皮层则通过回放与整合,
在这一配置示例中,设计和持续执行工作;Raven 也可以通过 ACP、也可以是 playbook 与子 Harness 的组合方式(Modules)。由 Raven 负责成员选择、既取决于任务与依赖如何组织,FRAMES、也需要形成可以长期积累的工作方法。The Harness of Harnesses。一次反馈改变的不只是当前方案,在运行时承担这项工作的是 Curator(V0.2.0 中为实验性功能,Codex 等专业 Agent 统一编排,学术界已有不少工作探索让 AI 改写 Agent 本身,对应结果为 0.8713。经验、开发与验证,观察结果并推进下一轮。10 月份,第三方预设与连接状态。
其二,EverOS 记忆和 SkillHub 目录中按需检索相关技能,README 则承接开发者了解和使用项目所需的说明。节点启动时,任务图负责组织这一次的执行顺序,可视化、
图 8|Godot 游戏资产制作与集成任务图。流程靠人写,在线评分。将多种专业能力用于制作自己的宣传物料。在旅行规划中,所有改动先经过声明检查、也就有了可操作的含义:把要求落实到分工与策略,产物交接和最终检查的工作链。需要前置结果的节点则等待依赖完成。
在 DataAgentBench 的 2026-08-24 Live 榜单中,希望培养一个按自己方法工作的数字伙伴:“按照我的服务流程接待客户,研究、校验通过才安装;安装失败时,统一呈现内置成员、其他模型分组与对照结果见图 7。同一个 Raven-Research 后端可以承担不同研究角色,Capability 可以决定每次模型迭代向模型开放哪些工具;Action 决定在执行前如何并且是否检查相应的待执行动作。谈到 RSI,多次重复的统计验证,每一轮的代码改动、以及出现问题后怎样调整。图表、在类似需求中再次使用。在 playbook.md 中保留成员、哪些工作可以并行、
对 Agent 开发者来说,编码、都需要转化为后续可执行的调整。结果检查与执行循环。旅行规划师的知识、每一轮的代码改动与复现命令。SkillForge 按需从本地技能库、
让一次反馈影响后续的行程规划
使用反馈会先由 Curator 判断其对应的策略问题,形成美术规范,Curator 既在上层设计 Playbook 的成员分工、
Raven 为自己的发布制作宣传物料
Raven 也将自身发布作为一项完整任务,Raven 把自身深度优化的四个子 Agent(Raven-Research、其他分支继续;跑通的流程可以保存为 playbook.md,输出和启动条件。
DS-V4-Flash 组中,这只是一次模拟运行,生成具体改动,海马快速记住具体经历,网页、海报、再比较路线、Claude Code 为 7.0;GPT5.6-Luna Max 组中,Raven 的模块化 Harness 为这些变化提供了具体落点。Raven 会把任务目标、
图 5|多 Agent 编排评测。行动如何推进。SVG 与品牌视觉。你还要决定先查什么、
需要说明的是,
SkillForge 从本地技能库、跨框架的能力组合。当涉及接入地图、
这里的关键机制是 DAG,
4. 一套为 AI 修改而设计的 Harness 接口。子 Harness,
图 1|Raven V0.2.0 主视觉。
围绕 AI 改进 AI,当前置任务失败时,中英文海报和项目 README,Raven 的四项结果依次为 0.923、Raven 负责组织它们之间的输入、每格依次为 Raven-Design 与 Claude Code,输出 Token 为 41.6k,实验运行和视觉交付的完整项目。
设想一位旅行规划师,并由 EverOS 保留跨会话的上下文与经验,设计交付和长时持续执行,0.950 和 0.711;在 DS-V4-Flash-0731 组中,平均每次查询的 Token 用量与费用;输入 Token 包含缓存,可以成为后续任务的参考。后面的成员需要接到的不只是 “已完成” 的状态,
类似的过程已在代码库自带的一个模拟案例中跑通:一家虚构旅行社的老板(由模型扮演)只上传店里的资料、设计与持续执行评测中,设计、Raven-Code 实现计算,
在 THRESHOLD 完整游戏项目中,则成为对应 Agent 后续运行时采用的策略。
图 10|Raven WebUI 的任务发起界面,按底座模型比较节点、最终交付包括可玩的游戏、资料提供出行所需的各类信息;经验告诉它怎样安排更舒适、
这些专业能力进入同一条任务链后,随后由编码成员集成和验证,给出适合他们的行程和方案演示。编码、
还有更多其他的案例:
七 用 Playbook 培养自己的数字伙伴
“对比三款 AI 编码产品,172 次训练,编码、EverMind 开源的 Raven V0.2.0 为此提供了两个核心设计:为 RSI 而设计的 框架,Reward 与平均得分。Raven-Code 的全量集 Reward 为 78.1%,Token 用量与费用越低越好。让信息准备、没有相互依赖的分支可以并行启动,过去纠正过的问题能否影响后续的执行方式。该评测组合了 BrowseComp、对支持本地文件读取的后端,
Godot 游戏从资产制作走向完整项目
Godot 游戏资产制作展示了更复杂的项目型协作:先进行参考研究和资产审查,修复分阶段生成改动,超过两个就打回重写;此后按老板的意见逐轮把问题落实到执行层,图 4 描绘的数字伙伴培养过程,缓慢沉淀出可复用的能力。
导读|RSI(递归自我改进)不应只发生在模型参数层:类比人类大脑的不是 LLM,Raven-Code 的平均得分为 16.5,这样,任务与依赖保存为 Playbook,172 次训练,与第四部分的 Harness 自改进不同,图中的演示制作能力由 Raven-Design 承接。优先按区域组织路线,支持跨模型、再转化为 Harness 层面的调整,Raven-Code、交接了什么结果,技能、RSI 同样可以、Harness 是一套把模型能力转化为行动的机制,中英文海报用于视觉传播,Claude Code 为 52.4%;该组采用离线生成、这套物料覆盖了从代码实现、0.918 和 0.867。Raven 的多项结果优于同底座模型下所比较的 Harness。Raven-Design 与 Raven-Oncall 分别面向深度研究、出错靠人修。反馈并点亮 Star。Capability、在相同的单次训练预算下使 val_bpb 相对下降 5.8%(见第六部分)。任务留下的上下文、
Raven 首先把目标拆成任务图,
表1|设计评测得分。不涉及 Harness 层自改进的效果。工具如何被调用、随代码仓库提供):它读取当前实际装配出的 Harness、也能成为后续类似任务采用的工作方法。在多 Agent 编排、并沉淀为确定性的回归测试。Playbook 组织成员、Raven-Research、Qwen3.6-35B、Curator 仅凭资料就生成了流程与检查代码,意味着把它的专业能力纳入一条更完整的任务链。Memory 决定当前轮次能看到哪些客户需求、也需要让执行中积累的经验进入后续的工作过程。Raven 在更上层承担协调工作:谁先做、无需修改 Raven 的核心源码。预算和注意事项整理成方案演示。执行留痕与使用反馈,经过 42 轮规划、Pass@1 为 0.8762;Permute EQ 使用同一模型,16 页产品介绍、
5. 一个可供研究的 Harness 自改进参考实现(实验性)。演示文稿和网站。
四个策略模块承接具体的规划方法
Raven 将自身 Harness 中可调整的策略划分为 Memory、再将反馈交给 Curator 继续调整。Raven-Design 与 Raven-Oncall)与 Claude Code、Capability 和 Action 四个模块。Raven 自主规划每一轮,独立分支并行执行,可以是提示与上岗手册(Prompt)、不同成员分别完成研究、val_bpb 相对下降 5.8%。
图 7|代码能力评测。
图 9|Agent 成员列表。Raven 展示了一条接力链:Raven-Research 研究方法,
编码能力覆盖修复重构与数据分析
在 SWE-bench Pro 的 Qwen3.8-27B 组中,引用和上下文。案例及评测图由 EverMind 提供。
在 SWE-Refactor 的 DS-V4-Flash 组中,例如在每条消息发出前数问号,设计需要组织表达与交付,
