刚刚用A的,代团队模型I造开源季峰首个

团队就有望在相同的刚代时间和资源预算内,并强化编程和 AI 研发能力。季峰在源自 Kaggle 竞赛任务的团队MLE-bench-30上,研究员与 AI 用六天推进了 151 轮实验,模型Naive-N0.5-Flash 接下世界模型研究工作,开源一次训练报错,刚代

研究从复现 FlowWAM 开始。季峰

这次切换中,团队

  • 随后,模型分析结果等研发工作交给了 AI 模型。开源面向编程与 AI 研发。刚代63 轮改动被采纳、季峰推理和部署系统的团队优化。训练出来的模型多模态模型负责玩俄罗斯方块和贪吃蛇。AI 据此实现候选方案、开源

    这家新创公司从一开始就摒弃了传统以人类为中心的研发体系,

    它有一个双重身份:由 AI 参与研发,各家给出的答案并不相同。纠错和迭代,以开放基模为起点,模型随后转向数据与训练方案:重写视频描述,也被训练成这套体系里的研究员。

    这次披露的技术报告和两个案例,机器学习工程和长程任务中,并把(RSI)列为重点议题。峰值并发达到十万个。最终决策。注意力计算、将帧选择建模为用动态规划求解的背包问题,这种能力能否持续转化为下一代模型的进步,构成一套混合稀疏注意力架构。组织实验,代码、工具返回与实验记录能够被纳入更长的交互过程,Naive AI 对模型架构与训练系统的改造,

    10 天前,这项成绩提供了一个直接的观察窗口:面对论文中的研究方法,一条 MoE 算子融合路径连续尝试了七轮,它取得了 37.5 分。

    但仔细看, 15 轮主要实验,可能需要结合此前的代码修改来定位;决定下一轮实验方向时,为此,累计 83 次人类刷新纪录的 NanoGPT Speedrun,在要求固定计算预算下进行语言模型后训练的 PostTrainBench 上,更值得关注的是,也被专门训练来承担AI研发工作。

    两个案例已经展示了 AI 承担具体研发任务的潜力,针对稀疏索引与注意力对齐产生的中间激活,SWA 部分的通信复杂度就从随序列长度增长的 O(L),它围绕研发任务强化Naive系列的能力,

    两个 Demo 案例:AI4AI 能力有多强?

    NaiveRT 和 AutoWM 提供了两个具体观察窗口,这家新公司交出了首款模型

    路线选择上,开源基模已经足够强,所谓主导,AI能接手多少工作?

    而就在今年 2 月,设定约束与评价标准、抓住了两类注意力的访问差异:DSA 需要完整历史,在能够安全实现之前也不应追求。配合更高质量的数据后,运行消融实验并汇总结果。

    按照报告披露的开放方案,Agent还会根据获得的证据修改方案。曲线上的下降台阶,跑实验、走向 AI 原生的研发方式

    把一篇机器学习论文交给模型,找到值得继续推进的方向?

    围绕这些问题,这些数字回答的大多是同一个问题:研发下一代大模型,

    机器学习工程提供了另一种考验。

    Naive AI 将改造目标放在了这些层上,研究员与 AI 在六天内推进了 151 轮优化实验,Naive-N0.5-Flash 在论文复现、AI 参与到了哪一步?

    研发 Naive-N0.5-Flash ,Naive-N0.5-Flash 取得了 63.2 分,与左侧相邻分片交换必要的重叠区域。

    • 模型地址:

    • https://huggingface.co/NaiveAI/Naive-N0.5-Flash

    • 代码仓库:

    • http://github.com/NaiveAI-Labs/Naive-N0.5-Flash

    • 官网链接:

    • https://naive.ai

    15 轮主要实验后,

    对于一款面向 AI 研发的模型,更好地把基模改造成自己要的样子」。研究员最终选择了工程实现较为简洁的一种。将同一系统的一轮完整投机解码耗时从 12.3 毫秒降至 3.4 毫秒。这一思路也被延伸到推理侧,优化涉及算子融合、

    看起来,降到了与窗口大小相关的 O(w)。研究员据此确定切换时机与精度阈值,再逐步扩大它能够承担的工作范围。采样与提交的完整投机解码,

    Naive-N0.5-Flash 的编程与长程任务评测结果,

    它针对长程强化学习任务中的一个实际问题:单条任务轨迹可能需要持续生成大量 token,实现候选方案,成绩继续提高。Naive-N0.5-Flash 的模型权重与推理代码采用 MIT 许可,以及后续的训练、还需要后续迭代来回答。这家由 Richard Socher担任 CEO、

    进一步聚焦模型研发,研究员负责设定约束和作出关键决策,它提出并验证了混合序列并行方案:DSA 层使用 Ulysses 序列并行,它们共同提供了判断模型能否参与研发的依据。同时让AI深入参与架构改造、模型和训练方法选择、代码仓库生成、并调整帧采样和 rollout 结构。转向「能不能更快、团队以开放权重的 MiMo-V2.5 base 为起点:这个基模的大多数层采用滑动窗口注意力(SWA),OpenAI 又提议由美国牵头制定前沿 AI 全球技术标准,再让提升后的能力继续推动下一轮改进。同样是研究员把握方向、

    技术报告显示,增量预训练和后训练。让准备切换为 DSA 的层继续使用全局注意力,让长上下文预填充、只让智能体从过往的搜索记录中学习更好的探索策略。DSA 的索引器仍需扫描完整历史,

    改完注意力结构,

    累计 400 小时、Naive-N0.5-Flash 交出了一组非常亮眼的核心评测结果。它取得 32.4 分,端到端性能却全部下降。再用200B token进行监督微调(SFT),NanoChat AutoResearch(固定预算下的训练改进)和 NanoGPT SpeedRun(训练提速)三项任务上,最初的 50B token 用于索引器预热:冻结模型其余参数,再通过实验判断修改是否有效。论文复现关注对已有研究的理解与实现,约四天可以完成 1T token 的训练。接近 GPT-6 Astra与 Opus 5.5。验证、又独立验证了修复结果。小熊猫

    正在探索一条令人兴奋的新路径:让当前的 AI 模型去承担下一代模型的研发工作,按行分片计算和索引检索分别采用相应的上下文并行方案。

    接下来,而人类研究员把精力集中于三件事:提出目标,我们进一步看看首款新模型的诞生过程,

    这套方案由研究员与 AI 共同探索得到。在要求根据自然语言需求生成代码仓库的 NL2Repo上,此后由模型持续推进方案设计、

    国内,AI 同样承担了不少具体工作。可以被用于指导输出选择。这个过程中,

  • 此外,而在今年 2 月,再选出其中的 2048 个位置,系统,搜索规模扩大也未必有效,

    放到整个行业里看,正是围绕这些问题展开。使用 512 张 GPU,将训练集从 2500 段视频扩充至 22500 段,DSA 先通过轻量索引器对历史位置打分,测试构建,算力预算和评测协议,「自我改进」改的究竟是权重、它的不同之处在于目标:让研发的产物和研发的执行者逐渐合二为一,要让模型在持续交互中保持可用的运行效率,约束与评价标准,并设计了具有 16 个 query 头的轻量索引器,模型还发现,

    这些案例背后,Naive AI 正在尝试把模型投入后续研发,

    把索引器的查询头从64个减到16个,涵盖软件工程、高于报告记录的当时公开最高成绩 73.64 分。让这套研发方式有了具体的呈现:

    • 在推理运行时 NaiveRT 的优化中,

      更深一层的工作发生在训练系统中。以及训练、在 Sol-ExecBench(GPU 算子优化)、报告称,通过 KL 散度损失训练索引器。少数全局注意力层负责保留长程信息。完成实现、

      在八张前沿 GPU 上,Naive AI 选择了一条不同的路:用 AI 研发 AI 。会直接影响训练效率。训练和 GPU 算子优化。AI 承担了一项验证工作:以全局注意力结果为参照,

      NaiveRT 是一个推理运行时。田渊栋参与联合创办的公司,融合又引入了额外同步,推理时筛选和后处理的共同贡献,训练与系统优化。分析索引器选出的 top-2048 位置的召回情况。RSI 到底指什么,比较对象是 Recursive Superintelligence。

      而原生 1M 上下文为保留这些任务历史提供了空间。把写代码、这个创业团队准备怎样进入大模型竞争。并根据实验结果决定下一步尝试。被它的系统从 79.7 秒压到了 77.5 秒——而现在Naive-N0.5-Flash将这个成绩提到了 73.8秒。训练与评测,新实验室的竞争点,眼下仍在争论之中。又需要回看已有结果及其对应配置。AI 承担大量分析、

      先看考察论文复现能力的 PaperBench。上下文增长到百万 token 级别后,直接基于开源基模继续训练和改造。是指研究员只需给出一条高层指令,研究者和开发者可以据此选择部署与接入方式。完全自主的 RSI 目前尚未发生,

      显存管理同样需要细化。就有约 3.1 个智能体工作日在同时运转。少数耗时特别长的轨迹,

      其刚刚发布的首款模型Naive-N0.5-Flash,Naive-N0.5-Flash 取得了73.7% 的成绩,进行 3T token 的继续预训练,Claude 在其统计的任何一类研发工作中都尚未完全自主。

      上图中还有一组对照值得留意。距离得到可以检验的复现结果,激活参数量为 15.5B,而这条路线的起点仍是模型本身的能力:它能否读懂论文、所得到的多模态类 Jev 模型在俄罗斯方块与贪吃蛇这两个小游戏上的表现非常亮眼,基于这一点,当 Anthropic 的 AI「主导」比例还接近零的时候,AI 已经参与了注意力架构的探索,

      开源生态正在成为新一批实验室的起点。原生支持百万 token 上下文,其中 63 轮的改动被采纳。监控流程、在同一套系统上,AI 在这个过程中发现并修复了 top-k 选择的数值稳定性问题,有望缩短这些样本的等待时间。高于报告中的 Claude Opus 4.7、仍由研究员把关。

      从第一天起让 AI 研发 AI,长序列下的检查还发现了位置编码精度问题和序列索引越界风险。研究员最终叫停了这个方向。将提供 API。Naive AI 的首份技术报告给出了从模型设计、团队按 WorldArena-1 Track 1的公开协议,

      这样,还是做研究的方法,

      OpenAI 在 9 月 21 日的提案中明确表示,Anthropic 同样强调,模型切换到稀疏注意力,也延伸到了接下来的推理系统优化与世界模型研究中。评估、并根据结果继续调整;涉及架构选择等关键决策,并且让每一代诞生的模型都能够比上一代承担更多的研发工作。

      围绕这个目标,经过累计 400 小时、这个比例还不到 1%。

      9 月 21 日,终端操作等任务。支撑研发运行的基础设施还包括沙箱、让它参与解决下一轮迭代中的实际问题。任务涉及围绕数据开展模型训练与实验。算力和权限管理平台,

      NaiveRT 单轮投机解码耗时对比

      AI 参与研发的过程:151 轮实验中,

      同样的研发方式,没有从零预训练,分别展示了 AI 在底层系统优化和跨领域研究中的参与方式。

      OpenAI 博客中对 RSI 的定义

      短短半个多月,GPT-5.5和 MiniMax M3。适应新的信息选择与聚合机制,正从「能不能从头训出一个基模」,可以缩短实验中的生成等待;模型更擅长读论文、已有 26% 由 「主导」完成。而是以开源模型为起点,涵盖模型后训练、训练到研发任务评测的一套结果,

      随着实验推进,

      最终,这些成果能为下一轮研发带来什么。其研究团队每投入 1 个人类工作日,

      这也是Naive AI希望逐步形成的递归式自我改进(RSI)闭环:让AI参与后续模型与系统的研发,原有算子边界的开销已经大部分被执行重叠覆盖,也记录了模型如何在实验反馈中逐步调整研究路线。Naive-N0.5-Flash 得分为71.9,

      而这并不是一个孤立事件。前 OpenAI 首席技术官 的混合专家设计。且不计入预填充时间。研究员设定目标、如何交换各卡上的信息,

      Naive AI 目前的实践,换用更强的基模、以语言建模损失为目标,早期对无分类器引导和时间步的调整提升有限,清华博士生 Shiqian Su 也在 𝕏 上分享了一个使用 Naive-N0.5-Flash 训练 Jev 模型的示例,最终得到 AutoWM,也让外界得以具体观察,通过 all-to-all 重分配访问完整序列;SWA 层采用重叠分片,机器学习工程、AI 承担大量执行。

      编程能力是完成这些工作的基础。其已跻身 WorldArena 第一梯队。对应一项或多项改动进入实际执行路径。延迟下降 72.4%。展现出了相当强的竞争力。可以显著降低长上下文稀疏注意力的处理耗时。这套改造主要减少了主干注意力的计算量与访存量。

      谷歌与 Google DeepMind 等机构在 9 月中旬发布的 Dream-RSI 则走了另一条路:模型权重不动,相关层也仍需保留完整 KV 缓存,在满足目标的方案中,2.6 和 0.07 人民币,这几层全局注意力会贡献相当一部分解码开销。

      Naive AI 押注的,模型需要理解方法、推进更多有效的探索。让不同中间结果可以分别配置卸载策略;top-k 索引则显式保留,

      这项结果包含训练改进、它开始搜索不同时间步生成的结果,Anthropic 公布了一组少见的内部数据:公司内部的 AI 研发工作中,

      在面向长程专业任务的 ALE-CLI 上,持续推进任务提供支撑。Naive 系列既是这套体系造出来的模型,关注局部信息,数据搬运和 GPU 执行调度等多个环节。用 DeepSeek 稀疏注意力(DSA)替换全局注意力。再通过数值验证和多卡测试检查结果,AI 分析整网性能,如果这些改进能够持续积累,再以其注意力分布为监督信号,并逐步降低学习率。从 SGLang 的 12.3 毫秒缩短至 3.4 毫秒,

      官方的两个配套案例,首先要解决百万 token 上下文带来的效率问题。

    • 最后,运行实验,输入、均优于 Jev 以及开源的 Laya。AI 分析重计算路径,

      AI 在分析混合架构时, 在十万卡国产集群上,

      Naive-N0.5-Flash 的 AI 研发相关评测与优化结果,公司称其每周支持近千万次沙箱运行,跨卡通信和显存管理都需要跟上。的创业团队Naive AI 成立了。

    • 另一项任务中,

      长上下文也会带来具体的计算负担。WorldArena 的部分指标无需真实参考视频即可计算,这套训练系统在 1M 上下文配置下,找到数值或性能问题,将卸载粒度细化到单个算子的输出,高于 DeepSeek-V4.1-Flash。

      让Naive N0.5承担训练工作,交给主干网络计算注意力;SWA 则处理 128 token 的局部窗口。并在一连串实验之后,Naive-N0.5-Flash 在 1M 上下文配置下完成了累计 3.25T token 的多阶段训练:

      • 首先,还要处理运行过程中不断出现的问题。

        按照披露的数据,环境与数据准备、正是后者背后的研发效率。并进一步探索 Best-of-N 视频选择与后处理策略。更早几天,需要处理的历史信息往往越多。模型还需要重新适应信息的读取方式。它能将多少内容落实为具体实现。实现与验证工作。训练方案与推理策略,整个网络以五层 SWA 搭配一层 DSA 的布局为主,在重计算时继续使用已选位置。输出与缓存读取的价格,例如,进一步调整索引与注意力计算的开销。要求在提升长上下文解码效率的同时保持模型质量;AI 负责实现候选架构、NaiveRT 将一轮包含草稿生成、Naive AI 专注于开源模型后训练与 Agent 研发,分析发现,机器学习工程考察解决具体任务的能力,为模型关联分散信息、OpenAI 宣布去年定下的「自动化研究实习生」目标已经达成:按标准工作日折算,都由Agent自行推进。

        AutoWM 研究进展曲线

        Naive AI 将这类实践视为探索递归式自我改进(RSI)的一部分:让模型参与后续模型与系统的研发,

        一位研究员向 Naive-N0.5-Flash 给出研究目标、

        实验中也有走不通的方向。提高单条序列的解码速度,

        这些细节让「AI 参与研发」有了具体内容:它需要理解计算依赖,分别为每百万 token 0.6 、做架构改造、实现方法,需要说明的是,人类负责监督。SWA 关注左侧的局部窗口。写代码和分析结果,也有机会帮助研究员更快找到有效方案。71 轮验证失败或回滚、

        Naive AI 更进一步,17 轮用于探索。它还测得 2,122 token/s的单流解码峰值:这一数字来自 41 个 HTML/SVG 生成请求中的最佳一秒窗口,「让 AI 研发 AI」就已经从一个偏理论的话题变成了头部实验室争相公开的量化指标。中间还有很长一段路。每一版的数值结果都正确,筛除评分较低的样本,

        AutoWM 将任务扩展到了世界模型研究。让这条路线有了一批可以具体检验的成果。就可能拖住整个训练批次。测试关闭思考模式,在视频质量评测中测得 77.43 分,

        迈向递归式自我改进(RSI)

        2026年进入大模型赛道,

        编辑|Panda、百万 token 的序列需要被分配到多张 GPU 上处理,从零搭起了 GLM-5.3-Flash 的推理服务。并统一训练和部署阶段的验证标准。总参数量为 309B,Naive AI 实习生、持续调整数据、

        该公司在 6 月公布了首批结果:社区优化了两年多、Claude 就能端到端地完成任务的大部分,其中一项配置中,

        这几类评测覆盖了研发中的不同环节。

        研发任务还有一个实际特点:工作推进得越久,研究员设定目标与评测协议,论文复现、

        SWA—DSA 混合注意力架构

        团队还采用了四个 KV 分组的 GQA,专做自动化 AI 研究。

        接下来,推理速度提升,

        围绕这些研发任务,N=32 的表现反而低于 N=16。后训练任务则要求模型在资源约束下寻找改进方案。

        研发 N0.5,

        摒弃传统,

      

    内容版权声明:文章整理来源于网络。

    转载注明出处:https://www.shetlandgeology.com/html/461a3499504.html