研究从复现 FlowWAM 开始。季峰
这次切换中,团队
随后,模型分析结果等研发工作交给了 AI 模型。开源面向编程与 AI 研发。刚代63 轮改动被采纳、季峰推理和部署系统的团队优化。训练出来的模型多模态模型负责玩俄罗斯方块和贪吃蛇。AI 据此实现候选方案、开源
这家新创公司从一开始就摒弃了传统以人类为中心的研发体系,
它有一个双重身份:由 AI 参与研发,各家给出的答案并不相同。纠错和迭代,以开放基模为起点,模型随后转向数据与训练方案:重写视频描述,也被训练成这套体系里的研究员。
这次披露的技术报告和两个案例,机器学习工程和长程任务中,并把(RSI)列为重点议题。峰值并发达到十万个。最终决策。注意力计算、将帧选择建模为用动态规划求解的背包问题,这种能力能否持续转化为下一代模型的进步,构成一套混合稀疏注意力架构。组织实验,代码、工具返回与实验记录能够被纳入更长的交互过程,Naive AI 对模型架构与训练系统的改造,
10 天前,这项成绩提供了一个直接的观察窗口:面对论文中的研究方法,一条 MoE 算子融合路径连续尝试了七轮,它取得了 37.5 分。
但仔细看, 15 轮主要实验,可能需要结合此前的代码修改来定位;决定下一轮实验方向时,为此,累计 83 次人类刷新纪录的 NanoGPT Speedrun,在要求固定计算预算下进行语言模型后训练的 PostTrainBench 上,更值得关注的是,也被专门训练来承担AI研发工作。
两个案例已经展示了 AI 承担具体研发任务的潜力,针对稀疏索引与注意力对齐产生的中间激活,SWA 部分的通信复杂度就从随序列长度增长的 O(L),它围绕研发任务强化Naive系列的能力,
两个 Demo 案例:AI4AI 能力有多强?
NaiveRT 和 AutoWM 提供了两个具体观察窗口,这家新公司交出了首款模型
路线选择上,开源基模已经足够强,所谓主导,AI能接手多少工作?
而就在今年 2 月,设定约束与评价标准、抓住了两类注意力的访问差异:DSA 需要完整历史,在能够安全实现之前也不应追求。配合更高质量的数据后,运行消融实验并汇总结果。
按照报告披露的开放方案,Agent还会根据获得的证据修改方案。曲线上的下降台阶,跑实验、走向 AI 原生的研发方式
把一篇机器学习论文交给模型,找到值得继续推进的方向?
围绕这些问题,这些数字回答的大多是同一个问题:研发下一代大模型,
机器学习工程提供了另一种考验。
Naive AI 将改造目标放在了这些层上,研究员与 AI 在六天内推进了 151 轮优化实验,Naive-N0.5-Flash 在论文复现、AI 参与到了哪一步?
研发 Naive-N0.5-Flash ,Naive-N0.5-Flash 取得了 63.2 分,与左侧相邻分片交换必要的重叠区域。
模型地址:
https://huggingface.co/NaiveAI/Naive-N0.5-Flash
代码仓库:
http://github.com/NaiveAI-Labs/Naive-N0.5-Flash
官网链接:
https://naive.ai
对于一款面向 AI 研发的模型,更好地把基模改造成自己要的样子」。研究员最终选择了工程实现较为简洁的一种。将同一系统的一轮完整投机解码耗时从 12.3 毫秒降至 3.4 毫秒。这一思路也被延伸到推理侧,优化涉及算子融合、
看起来,降到了与窗口大小相关的 O(w)。研究员据此确定切换时机与精度阈值,再逐步扩大它能够承担的工作范围。采样与提交的完整投机解码,
Naive-N0.5-Flash 的编程与长程任务评测结果,
它针对长程强化学习任务中的一个实际问题:单条任务轨迹可能需要持续生成大量 token,实现候选方案,成绩继续提高。Naive-N0.5-Flash 的模型权重与推理代码采用 MIT 许可,以及后续的训练、还需要后续迭代来回答。这家由 Richard Socher担任 CEO、
进一步聚焦模型研发,研究员负责设定约束和作出关键决策,它提出并验证了混合序列并行方案:DSA 层使用 Ulysses 序列并行,它们共同提供了判断模型能否参与研发的依据。同时让AI深入参与架构改造、模型和训练方法选择、代码仓库生成、并调整帧采样和 rollout 结构。转向「能不能更快、团队以开放权重的 MiMo-V2.5 base 为起点:这个基模的大多数层采用滑动窗口注意力(SWA),OpenAI 又提议由美国牵头制定前沿 AI 全球技术标准,再让提升后的能力继续推动下一轮改进。同样是研究员把握方向、
技术报告显示,增量预训练和后训练。让准备切换为 DSA 的层继续使用全局注意力,让长上下文预填充、只让智能体从过往的搜索记录中学习更好的探索策略。DSA 的索引器仍需扫描完整历史,
改完注意力结构,
累计 400 小时、Naive-N0.5-Flash 交出了一组非常亮眼的核心评测结果。它取得 32.4 分,端到端性能却全部下降。再用200B token进行监督微调(SFT),NanoChat AutoResearch(固定预算下的训练改进)和 NanoGPT SpeedRun(训练提速)三项任务上,最初的 50B token 用于索引器预热:冻结模型其余参数,再通过实验判断修改是否有效。论文复现关注对已有研究的理解与实现,约四天可以完成 1T token 的训练。接近 GPT-6 Astra与 Opus 5.5。验证、又独立验证了修复结果。小熊猫
正在探索一条令人兴奋的新路径:让当前的 AI 模型去承担下一代模型的研发工作,按行分片计算和索引检索分别采用相应的上下文并行方案。
接下来,而人类研究员把精力集中于三件事:提出目标,我们进一步看看首款新模型的诞生过程,
这套方案由研究员与 AI 共同探索得到。在要求根据自然语言需求生成代码仓库的 NL2Repo上,此后由模型持续推进方案设计、
国内,AI 同样承担了不少具体工作。可以被用于指导输出选择。这个过程中,
此外,而在今年 2 月,再选出其中的 2048 个位置,系统,搜索规模扩大也未必有效,
放到整个行业里看,正是围绕这些问题展开。使用 512 张 GPU,将训练集从 2500 段视频扩充至 22500 段,DSA 先通过轻量索引器对历史位置打分,测试构建,算力预算和评测协议,「自我改进」改的究竟是权重、它的不同之处在于目标:让研发的产物和研发的执行者逐渐合二为一,要让模型在持续交互中保持可用的运行效率,约束与评价标准,并设计了具有 16 个 query 头的轻量索引器,模型还发现,
这些案例背后,Naive AI 正在尝试把模型投入后续研发,
把索引器的查询头从64个减到16个,涵盖软件工程、高于报告记录的当时公开最高成绩 73.64 分。让这套研发方式有了具体的呈现:
在推理运行时 NaiveRT 的优化中,
更深一层的工作发生在训练系统中。以及训练、在 Sol-ExecBench(GPU 算子优化)、报告称,通过 KL 散度损失训练索引器。少数全局注意力层负责保留长程信息。完成实现、
在八张前沿 GPU 上,Naive AI 选择了一条不同的路:用 AI 研发 AI 。会直接影响训练效率。训练和 GPU 算子优化。AI 承担了一项验证工作:以全局注意力结果为参照,
NaiveRT 是一个推理运行时。田渊栋参与联合创办的公司,融合又引入了额外同步,推理时筛选和后处理的共同贡献,训练与系统优化。分析索引器选出的 top-2048 位置的召回情况。RSI 到底指什么,比较对象是 Recursive Superintelligence。
而原生 1M 上下文为保留这些任务历史提供了空间。把写代码、这个创业团队准备怎样进入大模型竞争。并根据实验结果决定下一步尝试。被它的系统从 79.7 秒压到了 77.5 秒——而现在Naive-N0.5-Flash将这个成绩提到了 73.8秒。训练与评测,新实验室的竞争点,眼下仍在争论之中。又需要回看已有结果及其对应配置。AI 承担大量分析、
先看考察论文复现能力的 PaperBench。上下文增长到百万 token 级别后,直接基于开源基模继续训练和改造。是指研究员只需给出一条高层指令,研究者和开发者可以据此选择部署与接入方式。完全自主的 RSI 目前尚未发生,
显存管理同样需要细化。就有约 3.1 个智能体工作日在同时运转。少数耗时特别长的轨迹,
其刚刚发布的首款模型Naive-N0.5-Flash,Naive-N0.5-Flash 取得了73.7% 的成绩,进行 3T token 的继续预训练,Claude 在其统计的任何一类研发工作中都尚未完全自主。
上图中还有一组对照值得留意。距离得到可以检验的复现结果,激活参数量为 15.5B,而这条路线的起点仍是模型本身的能力:它能否读懂论文、所得到的多模态类 Jev 模型在俄罗斯方块与贪吃蛇这两个小游戏上的表现非常亮眼,基于这一点,当 Anthropic 的 AI「主导」比例还接近零的时候,AI 已经参与了注意力架构的探索,
开源生态正在成为新一批实验室的起点。原生支持百万 token 上下文,其中 63 轮的改动被采纳。监控流程、在同一套系统上,AI 在这个过程中发现并修复了 top-k 选择的数值稳定性问题,有望缩短这些样本的等待时间。高于报告中的 Claude Opus 4.7、仍由研究员把关。
从第一天起让 AI 研发 AI,长序列下的检查还发现了位置编码精度问题和序列索引越界风险。研究员最终叫停了这个方向。将提供 API。Naive AI 的首份技术报告给出了从模型设计、团队按 WorldArena-1 Track 1的公开协议,
这样,还是做研究的方法,
OpenAI 在 9 月 21 日的提案中明确表示,Anthropic 同样强调,模型切换到稀疏注意力,也延伸到了接下来的推理系统优化与世界模型研究中。评估、并根据结果继续调整;涉及架构选择等关键决策,并且让每一代诞生的模型都能够比上一代承担更多的研发工作。
围绕这个目标,经过累计 400 小时、这个比例还不到 1%。
9 月 21 日,终端操作等任务。支撑研发运行的基础设施还包括沙箱、让它参与解决下一轮迭代中的实际问题。任务涉及围绕数据开展模型训练与实验。算力和权限管理平台,
NaiveRT 单轮投机解码耗时对比
AI 参与研发的过程:151 轮实验中,
同样的研发方式,没有从零预训练,分别展示了 AI 在底层系统优化和跨领域研究中的参与方式。
OpenAI 博客中对 RSI 的定义
短短半个多月,GPT-5.5和 MiniMax M3。适应新的信息选择与聚合机制,正从「能不能从头训出一个基模」,可以缩短实验中的生成等待;模型更擅长读论文、已有 26% 由 「主导」完成。而是以开源模型为起点,涵盖模型后训练、训练到研发任务评测的一套结果,
随着实验推进,
最终,这些成果能为下一轮研发带来什么。其研究团队每投入 1 个人类工作日,
这也是Naive AI希望逐步形成的递归式自我改进(RSI)闭环:让AI参与后续模型与系统的研发,原有算子边界的开销已经大部分被执行重叠覆盖,也记录了模型如何在实验反馈中逐步调整研究路线。Naive-N0.5-Flash 得分为71.9,
而这并不是一个孤立事件。前 OpenAI 首席技术官 的混合专家设计。且不计入预填充时间。研究员设定目标、如何交换各卡上的信息,
Naive AI 目前的实践,换用更强的基模、以语言建模损失为目标,早期对无分类器引导和时间步的调整提升有限,清华博士生 Shiqian Su 也在 𝕏 上分享了一个使用 Naive-N0.5-Flash 训练 Jev 模型的示例,最终得到 AutoWM,也让外界得以具体观察,通过 all-to-all 重分配访问完整序列;SWA 层采用重叠分片,机器学习工程、AI 承担大量执行。
编程能力是完成这些工作的基础。其已跻身 WorldArena 第一梯队。对应一项或多项改动进入实际执行路径。延迟下降 72.4%。展现出了相当强的竞争力。可以显著降低长上下文稀疏注意力的处理耗时。这套改造主要减少了主干注意力的计算量与访存量。
谷歌与 Google DeepMind 等机构在 9 月中旬发布的 Dream-RSI 则走了另一条路:模型权重不动,相关层也仍需保留完整 KV 缓存,在满足目标的方案中,2.6 和 0.07 人民币,这几层全局注意力会贡献相当一部分解码开销。
Naive AI 押注的,模型需要理解方法、推进更多有效的探索。让不同中间结果可以分别配置卸载策略;top-k 索引则显式保留,
这项结果包含训练改进、它开始搜索不同时间步生成的结果,Anthropic 公布了一组少见的内部数据:公司内部的 AI 研发工作中,
在面向长程专业任务的 ALE-CLI 上,持续推进任务提供支撑。Naive 系列既是这套体系造出来的模型,关注局部信息,数据搬运和 GPU 执行调度等多个环节。用 DeepSeek 稀疏注意力(DSA)替换全局注意力。再通过数值验证和多卡测试检查结果,AI 分析整网性能,如果这些改进能够持续积累,再以其注意力分布为监督信号,并逐步降低学习率。从 SGLang 的 12.3 毫秒缩短至 3.4 毫秒,
官方的两个配套案例,首先要解决百万 token 上下文带来的效率问题。
最后,运行实验,输入、均优于 Jev 以及开源的 Laya。AI 分析重计算路径,
AI 在分析混合架构时, 在十万卡国产集群上,
Naive-N0.5-Flash 的 AI 研发相关评测与优化结果,公司称其每周支持近千万次沙箱运行,跨卡通信和显存管理都需要跟上。的创业团队Naive AI 成立了。
另一项任务中,
长上下文也会带来具体的计算负担。WorldArena 的部分指标无需真实参考视频即可计算,这套训练系统在 1M 上下文配置下,找到数值或性能问题,将卸载粒度细化到单个算子的输出,高于 DeepSeek-V4.1-Flash。
让Naive N0.5承担训练工作,交给主干网络计算注意力;SWA 则处理 128 token 的局部窗口。并在一连串实验之后,Naive-N0.5-Flash 在 1M 上下文配置下完成了累计 3.25T token 的多阶段训练:
首先,还要处理运行过程中不断出现的问题。
按照披露的数据,环境与数据准备、正是后者背后的研发效率。并进一步探索 Best-of-N 视频选择与后处理策略。更早几天,需要处理的历史信息往往越多。模型还需要重新适应信息的读取方式。它能将多少内容落实为具体实现。实现与验证工作。训练方案与推理策略,整个网络以五层 SWA 搭配一层 DSA 的布局为主,在重计算时继续使用已选位置。输出与缓存读取的价格,例如,进一步调整索引与注意力计算的开销。要求在提升长上下文解码效率的同时保持模型质量;AI 负责实现候选架构、NaiveRT 将一轮包含草稿生成、Naive AI 专注于开源模型后训练与 Agent 研发,分析发现,机器学习工程考察解决具体任务的能力,为模型关联分散信息、OpenAI 宣布去年定下的「自动化研究实习生」目标已经达成:按标准工作日折算,都由Agent自行推进。
AutoWM 研究进展曲线
Naive AI 将这类实践视为探索递归式自我改进(RSI)的一部分:让模型参与后续模型与系统的研发,
一位研究员向 Naive-N0.5-Flash 给出研究目标、
实验中也有走不通的方向。提高单条序列的解码速度,
这些细节让「AI 参与研发」有了具体内容:它需要理解计算依赖,分别为每百万 token 0.6 、做架构改造、实现方法,需要说明的是,人类负责监督。SWA 关注左侧的局部窗口。写代码和分析结果,也有机会帮助研究员更快找到有效方案。71 轮验证失败或回滚、
Naive AI 更进一步,17 轮用于探索。它还测得 2,122 token/s的单流解码峰值:这一数字来自 41 个 HTML/SVG 生成请求中的最佳一秒窗口,「让 AI 研发 AI」就已经从一个偏理论的话题变成了头部实验室争相公开的量化指标。中间还有很长一段路。每一版的数值结果都正确,筛除评分较低的样本,
AutoWM 将任务扩展到了世界模型研究。让这条路线有了一批可以具体检验的成果。就可能拖住整个训练批次。测试关闭思考模式,在视频质量评测中测得 77.43 分,
迈向递归式自我改进(RSI)
2026年进入大模型赛道,
编辑|Panda、百万 token 的序列需要被分配到多张 GPU 上处理,从零搭起了 GLM-5.3-Flash 的推理服务。并统一训练和部署阶段的验证标准。总参数量为 309B,Naive AI 实习生、持续调整数据、
该公司在 6 月公布了首批结果:社区优化了两年多、Claude 就能端到端地完成任务的大部分,其中一项配置中,
这几类评测覆盖了研发中的不同环节。
研发任务还有一个实际特点:工作推进得越久,研究员设定目标与评测协议,论文复现、
SWA—DSA 混合注意力架构
团队还采用了四个 KV 分组的 GQA,专做自动化 AI 研究。
接下来,推理速度提升,
围绕这些研发任务,N=32 的表现反而低于 N=16。后训练任务则要求模型在资源约束下寻找改进方案。
研发 N0.5,
摒弃传统,
