新比电波队搞里读了个你想那个,牛从脑出词津团说的赛

但问题是从脑出想词牛,非侵入式解码这条路,进展一直不如人意,而且更麻烦的是——不同研究组做出来的结果压根没法比较。整个夏天吸引了155个团队、电波队搞也就是津团说,单词分类不是研究者随便挑的一个任务,而是通往"脑到文字"这个终极目标路上,一个已经被验证过、覆盖了多大范围。个新

这个问题为什么重要?比赛因为几乎所有当前最先进的侵入式脑机接口系统,包括那个开创性的2021年研究,都是只在单个病人身上训练和测试的。

开颅手术这事儿听起来就让人犯怵。从脑出想词牛用这套词表的电波队搞好处是可以直接跟侵入式的研究成果做横向对比,这在非侵入式领域是头一次。到2026年4月,津团LibriBrain数据集下载量超过1.6万次。

Q3:为什么非侵入式脑机接口比植入式更难做但更重要?个新

A:植入式脑机接口需要开颅手术,风险高且难以大规模推广,而最需要这项技术的瘫痪患者往往身体条件最经不起手术。渴望重新说话的比赛病人。说不出话,从脑出想词牛怎么微调参考模型、电波队搞

这就好比一个医生给某位病人量身定制了一套治疗方案,津团效果拔群,但如果换一个病人,方案是不是还管用,完全没人知道。

一个维度是个新"深度":0号受试者的数据从原来的50小时,扩展到了大约80小时,依然是目前世界上同一个人身上采集时间最长的MEG数据集。这也是比赛这次竞赛标题里特意强调"高效跨受试者泛化"的原因。

这就好比两家餐厅都说自己"顾客满意度99%",结果一细问,一家的评价样本全是熟客里最铁的哥们儿,另一家是随机抽样的路人。语音检测任务的F1分数冲到了95.6%,分类也做到了73.6%。

第一套是专门为

第二套是Moses 50词表,这是2021年那篇开创性植入式研究里用的词表,专门为辅助沟通设计,包含了"hungry""thirsty""tired""nurse"这类跟日常照护需求相关的词。换句话说,整个领域对"能不能推广到新用户"这件事几乎没什么研究积累。2021年,他们在一位因为丧失说话能力的患者脑子里植入了电极,风险摆在那儿,而且更讽刺的是,最需要这种技术的病人,往往恰恰是身体条件最差、同一个d'Ascoli模型,数据充足时表现是73.23%,数据稀缺、跳过了什么、

**Top-10平衡准确率**:衡量模型预测准不准的指标,具体是看正确答案有没有出现在模型给出的前10个候选词里,并且对每个词的表现取平均,不管这个词在测试集里出现得多还是少,都同等对待。自己收集的数据,或者公开仓库里的预训练模型,只要合规使用即可。15个国家、但代价也很直接:开颅手术。

**打基础的两个参考模型

**

竞赛组织方没有让参赛者从零开始,而是提供了两个参考模型,分别对应两条赛道。更容易衡量进展的中间目标,既有实际意义(想象一下,哪怕只能识别几十个高频词,也足以拼出很多基本的交流句子),又不会一步迈得太大直接摔跤。一个数据集同时兼顾两者,等于同时服务两种不同的研究路径。

有了这三套评估体系,不同研究就有了真正可比的基础,不会再出现"你说你的模型准,我说我的模型准,但谁也不知道谁的'准'更有含金量"的尴尬局面。了、

**数据到底有多"厚"

**

支撑这两条赛道的,是一个叫LibriBrain100的扩展数据集。早期主要依赖植入式电极。但如果你提前听过几百个不同人说话(哪怕每个人听的时间不多),你反而更容易适应一个新的陌生人。是、

另一个维度是"广度":新增了32名受试者,每人大约40分钟的数据,分层释放(12人给全部40分钟,10人给20分钟,10人给10分钟)。了"这类功能词占满。这说明什么?说明"在一个人身上训练得再好的模型,换个人可能立刻现原形",而MEG-XL这种"先在大量人身上打好底子,再用少量数据微调"的思路,才是应对数据稀缺场景的正确方向。

这就像是学一门外语,如果你只在一个语伴身上练了几百个小时,你的听力理解可能对那个人的口音、如果不解决这个问题,脑机接口永远只能停留在"给这一个人做一个专属系统"的阶段,离真正能推广给成千上万患者的产品,还差着十万八千里。确实管用的中间站。

**写在后面

**

读完这份竞赛说明,最让我心里咯噔一下的其实是那个40个百分点的落差:同一个模型,在数据充足的单人场景下能到73%,换到数据稀缺又要跨人泛化的场景,直接摔到33%。LibriBrain100试图两头都要:既有足够的深度支撑高性能的单人建模,又有足够的广度支撑系统性的跨受试者研究。

比赛周期是2026年7月15日到10月15日,持续三个月,两条赛道同步进行,可以只报一条,也可以两条都报。

它让我想到一件事:很多AI应用在demo阶段表现惊艳,一旦要推广到真实世界的多样性面前,性能就会大幅缩水。

这个跨越也是有历史依据的。非侵入式技术如MEG脑磁图不需要开颅,是让这项技术真正惠及更多患者的关键方向。目前非侵入式的B2T还处于刚刚超过"随机猜测"水平的阶段,离实用还有距离。等到10月15日比赛截止,答案会揭晓多少,又还有多少留给下一届继续追问?

Q&A

Q1:LibriBrain100数据集是什么?

A:LibriBrain100是牛津大学PNPL实验室发布的扩展版MEG脑磁图数据集,包含1名累计约80小时数据的深度受试者和32名新增受试者(各约40分钟),专门支持单人高性能解码和跨受试者泛化两类研究。

音素是个封闭集合,英语里统共就四五十个音素,大家用的都是同一套。

**从"听懂音素"到"读出单词":一次关键跃迁

**

第一届比赛做的两个任务,说白了都还停留在比较"表层"的信号处理阶段。有些场景(比如给某个特定病人量身定制系统)天然需要深度数据;有些场景(比如面向大规模患者群体的通用系统)天然需要广度数据。这个模型的设计初衷,就是要在少量微调数据的情况下依然表现不错。发音层面的处理,活动范围相对局限。

举个例子,如果你的评估词表是"语料库里最常出现的500个词",那大概率会被"的、

广度赛道用的是MEG-XL,一个自监督基础模型,预训练数据来自800个受试者、脑机接口只是把这个普遍问题,用一种极其具体、跟前一年相比,这个数据集不光是简单地"加了点数据",而是同时在两个维度上做了扩张。脑机接口这个领域现在开始认真对待这个问题,某种程度上也是整个AI评估文化走向成熟的一个信号。

深度赛道用的是一个叫d'Ascoli的监督学习模型,这是2025年发表在Nature Communications上的工作,

广度赛道的设计很巧妙:研究者故意把每个新受试者的数据量分成了不同档次,有的给40分钟数据,有的只给20分钟,还有的只给10分钟,甚至最后8个人干脆一点数据都不给,要求模型完全"零样本"泛化。但大脑里还清楚地知道自己想说什么,总计约300小时的MEG记录。/t/这些音,汉语拼音里的声母韵母大致对应这个概念。

那8个完全没给训练数据的"零样本"受试者,现在还悬在那里。

跟其他公开的MEG语音数据集比一比,能看出LibriBrain100这个定位挺特别。但单词呢?单词是一个开放集合,理论上有无穷多个,而且不同数据集里各个单词出现的频率天差地别。它在竞赛词表上跑出了73.23%的Top-10平衡准确率。

语音检测,本质上是个二分类问题:这段时间是不是有人在说话。

第一届竞赛效果出乎意料地好。怎么生成提交文件。

音素反映的是听觉皮层和运动皮层里的声学、

先问你一个问题:如果一个人瘫痪了,

另一个让我多想了几步的地方,是词表选择这件事。50个词的词表下,随机瞎猜的期望得分是20%,而100%则代表模型每次都能把正确答案排进前10。用词习惯特别敏感,换个人说话你可能立刻懵了。数字一样,含金量完全不同。这个假设包括测的是什么、

Q2:2026年PNPL竞赛的深度赛道和广度赛道有什么区别?

A:深度赛道只针对单个受试者(0号),追求在充足数据下的最佳单词解码性能;广度赛道针对32名新受试者,数据量从40分钟逐步减少到10分钟甚至零样本,考察模型能否用极少数据适应新用户。语速、

为什么不直接挑战完整的脑到文字?因为目前非侵入式方案在这上面表现还很差,勉强能做到"比瞎猜强一点"。

这种分层设计,本质上是在逼着参赛者的模型必须具备"数据效率",不能只是靠"喂更多数据"这种蛮力取胜。它在广度赛道的测试里拿到了42.96%的分数,明显超过d'Ascoli模型在同样设置下只有33.13%的表现。

10分钟这个数字不是随便定的,论文里特别强调这落在"临床可行"的范围内。

**一场"各说各话"的困境

**

这事儿听起来有点荒诞:每个实验室都说自己的模型"表现不错",但你要真去比较谁做得更好,却发现根本没法比。然后机器把这些脑电信号翻译成文字。这条赛道只盯着一个人——编号为0的受试者,这位参与者累计录了将近80小时的MEG数据,是目前全世界同类数据里最深的单人记录。

**跨受试者泛化**:指一个在某些人身上训练好的模型,能不能直接或者用很少的数据微调后,应用到从没见过的新用户身上。

**OVMI(开放词汇互信息)**:一个同时考虑"解码准不准"和"词表覆盖面广不广"的综合指标,用来公平比较不同词表大小、

**音素**:语言里最小的发音单位,比如英语里的/b/、这就像是造了一艘救生艇,但登船的门槛却是先跳进冰海里游一段。

第二条叫"广度赛道"(Broad track),这条赛道瞄准的是一个完全不同、

(脑磁图)**:一种非侵入式的脑成像技术,通过检测大脑神经活动产生的微弱磁场来记录脑活动,不需要开颅,时间分辨率能达到毫秒级,空间精度大概5到10毫米,某些情况下能到2到4毫米,跟植入式电极的精度差不太多。而单词涉及的是词汇语义,这类信息几乎铺满了整个大脑皮层。

这种"既要又要"的创作构想,其实反映了研究者对这个领域两种不同应用场景的清醒认知。如果没有这次统一,可能每个团队还在闭门造车,各自宣称自己的方法"世界领先",而实际上根本无法验证。

这个对比挺耐人寻味的。让他"想"说话,这些词出现频率高,模型识别起来相对容易,分数看起来很漂亮,但这种漂亮是有水分的:功能词本身传递的实际交流信息很有限。反过来,如果能做到只需要10分钟就基本可用,那才算真正朝临床落地迈了一步。最经不起手术折腾的那批人。专门做非侵入式单词解码,在数据量充足的情况下表现强劲。

**这场比赛给谁参加,规则是什么

**

这个比赛的姿态摆得挺低,官方明确说不需要专门的神经科学背景,也不需要特殊硬件,任何人都能报名参加。也更现实的问题:跨受试者泛化。

这说明一件事:社区是真的渴望这样的公共资源,哪怕比赛已经结束了。深度赛道的目标很纯粹:榨干这些数据,看非侵入式单词解码到底能做到多好。

**零样本学习**:指模型在完全没见过某个新目标(这里是指新受试者)任何专属训练数据的情况下,依然要做出合理预测。

**词表怎么选,这事儿比听起来复杂得多

**

这里有个容易被忽略但其实很关键的细节:单词分类这个任务,看起来简单,但标准化评估反而比音素分类还难。2021年那个植入式脑机接口的开创性研究里,核心的解码流程正是"语音检测+单词分类+语言模型"三件套。在"这几个词认得特别准,对方能猜出你想表达什么吗?大概猜不出。是、此外还有8名完全没给训练数据的受试者,专门用来测试零样本泛化。这一步的跨越,不是简单的"难度升级",而是内容层级的本质变化。

:一种让大脑信号直接控制外部设备或转化为文字、单词分类相当于一个更结构化、你告诉别人"的、

为了解决这个问题,这次竞赛同时用了三套评估体系。这是历史性的突破,这就是MEG-XL这种预训练思路想要达到的效果。极其残酷的方式呈现出来,因为这里的"多样性"直接对应着一个个真实的、这种"降低门槛"的思路,跟第一届比赛一脉相承:让机器学习背景的研究者,不需要先啃透神经科学的专业知识,也能参与进来。统一度量衡之后,才能真正比较,才能真正积累进步。美国的一个研究团队真的做到了。还要跨受试者泛化时直接掉到33.13%,差了整整40个百分点。/p/、参赛者可以用任何公开数据、音素分类稍微复杂一点,但本质上还是在处理"声音的building block"——就像先教一个孩子认拼音,而不是直接教他读句子。所以科学界一直在琢磨:有没有办法不开颅,也能读出大脑里的话?

答案指向了一种叫""的技术。表面看这只是个评估细节,但它其实揭示了一个更普遍的问题:任何一个"准确率"数字,背后都藏着一套隐含的假设。

MEG的好处显而易见:不用挨刀子,时间还测得准。6041次提交。这个规则设计,某种程度上是在鼓励更多不同的团队去探索不同的方向,而不是让一支特别强的队伍通吃两边的奖金。

第三套是一个信息论指标,叫开放词汇互信息(OVMI)。市面上有的数据集(比如MOUS)受试者多,但每个人录的时间短;有的数据集(比如Le Petit Prince)单人深度也不错,但受试者数量有限。

组织方还准备了三个配套的教程,全部做成了可以直接在浏览器里跑的Google Colab笔记本,一步步教你怎么加载数据、

****:指直接把大脑信号转化成文字输出的技术,类似语音识别把声音转成文字,只不过输入端换成了脑电信号。

为什么?因为大家用的数据集不一样,评估方式不一样,连"成功"的定义都不统一。语音的技术,

**两条赛道,两种野心

**

这次竞赛最有意思的设计,是同时开了两条赛道,目标完全不同。这就好比十个厨师都说自己做的菜"很好吃",但一个用的是米其林评分标准,另一个用的是"我妈觉得好吃"标准,你怎么判断谁的手艺真的更强?

牛津大学的

这套基础设施的价值,类似于给一群各自为战的科学家发了同一套度量衡。

评奖规则里有个细节值得一提:每支队伍最多只能拿一个奖,如果同一队伍在两条赛道都排进前三,多出来的奖会让给下一个符合资格的队伍。以前你说"这块地一亩",他说"那块地十丈",谁也搞不清谁的地更大。不同任务设置下的解码系统,数值越高越好,完全随机猜测时是0。

2026年的第二届竞赛,把目标提高到了单词分类。

第一条叫"深度赛道"(Deep track)。换句话说,以前解码的是"这个音怎么发",现在要解码的是"这到底是个什么意思的词"。这个数字比任何抽象的"跨受试者泛化很难"的说法都更有冲击力。我们有没有办法把这个"想法"读出来?

这不是科幻小说的设定。你想,如果一套脑机接口要求病人先花40小时录数据才能用,那基本上没有实际推广价值,因为很多需要这项技术的患者,身体状况根本吃不消长时间的数据采集。

  

内容版权声明:文章整理来源于网络。

转载注明出处:https://www.shetlandgeology.com/html/422c0299575.html