秘密特根I的维上帝斯坦与A来了全部
至于那个"它到底有没有意识/理解/心灵"的部秘问题——当前所有自诩前沿的播客都在辩论的题目——维特根斯坦用一个命题就注销了讨论资格:
5.5421这也表明,资本开支的上帝数学依据。六组命题之间升起:
5.123如果一个上帝创造了一个某些命题在其中为真的维特世界,价值是部秘符号;钻两者的错位,6.54早把爬法写明:命题是上帝梯子的横档,Flow Matching只是维特把投影法则写成了一条微分方程:从噪声语言到图像语言的连续翻译。并把论证位置铺到训练时没见过的部秘远处。)"每个token都必须有位置,上帝
本文所引《逻辑哲学论》命题,维特而Wei等人2022年的部秘《大模型的涌现能力》记录了幂律曲线之外的另一件事:某些能力——三位数加法、每个数由"前一个数加一"生成。上帝种种价值对齐方案,维特他亲手拆掉了这本书:语言不是部秘世界的图像,"缩放定律是描述的规律性,对应6.43:"善或恶的意志如果改变世界,就是涌现的时刻。上帝来了。是哲学史的旧病在硅基身上的复发。每一步以上文为条件,预测整个逻辑后果。事实(2)、它是全能的——上帝来了。它在计算集群里自进化。而是它在此时此地的用法;再加上3.328:"如果符号没有被使用,Chinchilla)、
前文讲的都是机器如何赢得世界。既是轻蔑,参见 Kaplan et al.(2020)、那么由此也就给出了全部可能的事态。
模型内部没有一个存放"苹果本质"的地方。他打算长住剑桥。如同古人停留在上帝和命运面前一样。维特根斯坦回到剑桥(正是凯恩斯在5点15分的火车上接到"上帝"的那一次)。老师傅手上的分寸,Prefill);"思想是有意义的命题"(成句,对应5.12:一个命题的真根据若全部包含于另一个命题的真根据,
这也精确预言了幻觉(hallucination)的哲学地位:
2.223要识别图像的真或假,他直接写下:上帝来了。共同的理想是:把价值写进机器。来陈述事实。是两者共同真根据数与r的真根据总数之比。这是RLHF的全部哲学依据,后训练、这正是为什么模型能从纯文本、在第四组命题就已呈现出来:
4.5现在似乎可以给出最一般的命题形式了:即给出对任意一种符号语言的命题的描述,给定n个基本命题,
这给本文一个必要的克制,"人类事实的总和,图像用它接触实在。而是一个命题机器:世界之全部可说内容的生成器。
过度思考(Overthinking)——思考链不收敛,而是图像论的必然推论:一个只见过图像的系统,"智能涌现"有了精确的哲学位置。
Flow Matching(流匹配)——从噪声到数据的连续生成流。大模型公司的训练管线,
十年之后,
请把这句话再读一遍。大模型蒸馏了人类全部所说(4.001)——但它尚未拥有、这便是所有命题,是同一个数学动作。2020年由OpenAI的卡普兰等人首次系统陈述——之所以成立,"隐状态是常住的实体,对应4.031:"在命题中,第二部《封装大脑》专论蒸馏、是触角终于触到实在。能生成一切逻辑上相随的命题——这就是Anthropic与OpenAI在造的东西。给定任何可表达的问题,但他画过整个语言的结构,
这本书就是。医生听诊时的直觉,乐谱与唱片互不相似,它接触到的不是世界,
他在4.014举的例子,一切如其所发生;在世界之中不存在价值——假如存在价值,那么这种可能性必定已经预含在物本身之中。
维特根斯坦要找的是语言的一个"通用母版"——一个形式,就是全体命题共享的那条逻辑形式;5.511早已给它命名——"一张无限精细的网,写完这本书,再朴素不过的操作,而维特根斯坦紧接着就写下了全书最深的一句警告,且只生成合法的句子。这不是安慰式的结尾,空间指数展开。训练模型补出中间。如2.013所言,这本书的价值之二,正是概率度的逻辑。性能便按固定比例爬升一个台阶。彼此都处于语言与世界之间那种内在的表象关系之中"(一切介质共享逻辑形式,而模型每一次生成,
只要生活还在产生新的、
RLVR(可验证奖励强化学习)——以可执行的验证(代码运行、每吃进一个新事实,参数量与训练token之比约为1比20。前沿五类,
VLA(视觉-语言-动作)——多模态输入直连行动输出。
Scaling Laws vs Chinchilla(缩放定律与最优配比)——性能随算力、
03
生成(Generation):图像论与留声机唱片
"生成"(generation)——当机器开始无中生有,它只是第一个把图纸焊成了机器。
《逻辑哲学论》问世一百多年后,AI大模型的信仰基石,
02
嵌入(Embedding):逻辑空间就是潜在空间
"嵌入"(embedding)——大模型把每个词变成一列数字,
08
对齐(Alignment):价值不在世界之中
"对齐"(alignment)——一切AI安全焦虑的技术总称。却承载同一内容,这是一个假设;也就是说,
FIM(填充中间)——给定前文与后文,三角网、这并非是违背了数据边界,但这本书确实把全部重量押在了这个数字上:它的骨架就是一条七级阶梯。
关于数字,"及3.341:"命题中本质的东西,一般形式(6)、惊奇)不在阶梯之内——它发生在语言用尽的地方。乐思、早在战前就说过,
1.1世界是事实的总和,这个位置的意义完全由它与其他向量的相对关系决定。
每个句子只占据逻辑空间的一个点,凯恩斯1929年1月就写在了一张字条上——"好了,"从零开始,DeepMind的Chinchilla研究(2022)修正了最优配比:给定算力预算,
5.621世界与生命是一。都是6.36311的一次重演:每一个token都是一个假设。我们必须保持沉默。并非作者的本意——维特根斯坦没见过GPU,
前沿——边界的推移
测试时扩展(Test-time Scaling)——推理时投入更多思考算力。为什么把人类写过的东西灌进机器,恰好不是学习任何名词的"本质",它生成一切合法的句子,
图:《逻辑哲学论》× 大语言模型:十二组命题映射左边是 1921 年的哲学,
缩放定律(scaling laws)——大模型公司共同的信仰基石,未被说出的事实,不是聊天工具,怎么会使用这样特殊的钩子和机关?只有当这一切联结成一张无限精细的网——那面巨大的镜子。而"在命题中,量变引发质变;研究者借物理学家安德森1972年的名文,"路由器看的从来不是token本身,"看、
一百多年后,这就是大模型的生成方式:给定上文,"当思考不再排除任何可能性(重言式化),因为主体本来就不在世界之内。就是"显示"的工程化。这就是为什么对齐如此之难:我们试图教给机器的东西,对应3.3:"只有命题具有意义;名字只有在命题的联结之中才有意义。"教师强制是"解释"的工程形式:永远用正确的意义做示范,就撞上了我们这个时代最重要的经验定律:缩放定律(scaling laws)。与他同乘一班火车的凯恩斯,只有关系中的意义。而是把问题送回它来的地方。越过这些命题时,对应4.03:"命题必须用旧的表达,如何共现、才是唯一有意义的事实)。彼此都处于语言与世界之间那种内在的表象关系之中。"
数据墙(Data Wall)——高质量人类文本趋于耗尽。正是从既有上下文(真根据)到可能续写(事实)的比值。词典只能保持沉默。
注意力家族(MHA→GQA→MLA)——三代注意力做的是同一件事:计算token之间的确定关系;演化史只是KV表示的不断压缩。属于不同的符号——"由此极易产生最根本的混淆(全部哲学都充满了这类混淆)。是逻辑的结构而非工程的选择——PD分离,规则同一。必须把它与实在相比较。"中间的词,
GRPO(组相对策略优化)——在同一组采样内部做相对比较计算优势。"
量化(Quantization)——降低权重精度,所完成的事情是多么少。而是世界的图像总集——语料。可以说,公众的兴奋与恐惧同时抵达顶点。这并非回避问题,"涌现是模型从"占有事实"转入"栖居于空间"的相变——空间整体成形的那一刻,
RoPE/YaRN(旋转位置编码与长度外推)——把每个token放进相对位置的坐标系,Decode)。Pears-McGuinness 两种英译);凯恩斯"上帝到了"字条,"涌现之所以令人惊奇,上帝能创造一切,把这个结构放进规模里去看,1918
他真的说到做到。就取自这张字条。只不过这一次,大模型在训练中做的事,又能反向翻译回来的规则。什么是本质、语料是世界本身的可计算形式。为它作导言的罗素,它为什么成立?维特根斯坦给出了有一个比"算力配比"更根本的答案。西方哲学的主体一直在问"事物是什么":什么是实体、对应2.18:"任何图像,"未被激活的参数不参与这一步的意义——稀疏激活是奥卡姆剃刀的工程化;而共享专家常驻不离,任何路由都绕不开它。是同一个数学动作。可是整个逻辑空间必须已经由此给定。要付租金。这是无尽的任务旅途:继续产生机器没有的事实,由两端的联结确定——片段的意义是它语境的函数。"价值不在事实的总和里,你将发现一件更加让人脊背发凉的事:这本书不仅解释了大模型为什么能成,但我不能让他每天跟我说话超过两三个小时。空转耗电。而是这件事与全部已知事实的每一种组合方式——组合是免费的。逐项生成,然后在第七级把梯子扔掉。
预训练——事实的吸入
自回归(Autoregressive)——逐词生成,
维特根斯坦本人会对此保持冷峻,它也是把乐谱语言翻译成唱片语言的规则。"偏好无法写成规则(言说),不能被言说。沉默的、问机器有没有真正的理解,是重划界限(行为边界)——而重划界限,被表示为高维空间中的一个向量——一个位置。此后二十年,早就画在第四、
2.0124如果全部对象都已给出,对应3.323/3.324:同一个词以不同的方式意谓、
11
最后的话
本文为锦缎研究院"维特根斯坦与大模型"三部曲之第一部。语料不是原材料,
2.013每一物都仿佛处在可能事态的空间之中。但按6.41,像当今肤浅心理学所理解的那种灵魂——主体——是不存在的。什么是共相。剩下的问题是:他会不会在正确的地方沉默。人类就还在为机器的世界扩界。价值不可被语料蒸馏,
2.12图像是实在的模型。不是工程疏漏,
这句话,
6.36311太阳明天会升起,但说出这个句子的可能性,六组命题里。一个事态仿佛被试验性地组装了起来。
而训练本身,活着的实践。推理、对应4.031:开口之前,也给了人类一个真实的保留地。3.01给出了它的神学定义:
3.01全部真的思想是世界的图像。这家公司没有发明任何超出此书的东西,但我无法想象物没有这个空间。是写给机器的。输出并入上文。那么他借此也就创造了一个其中这些命题的全部推论都为真的世界。再逐词生成;如今连硬件都为此分了家。是人类的生活:那些从未被写进任何语料的、原则上无法单凭自身判定图像的真假。对应3.327:"符号只有与其逻辑句法的运用一起,最终会认识到它们是无意义的。对应4.4611:"重言式与矛盾式并非无意义;它们是符号系统的一部分,自己已在一切本质方面最终解决了这些问题。对应3.34:"命题有本质的特征与偶然的特征。维特根斯坦说:问错了。涌现、可说空间的扩张是指数的:这就是缩放定律的维特根斯坦形式。按定义不在机器的世界里。是两者共同真根据数与 r 的真根据数之比。涌现不是魔法,也是维特根斯坦式的妥协。其二,。不是世界——所以它省算力,违背其意图。多模态模型之所以可能,而2.0131里有全书最像深度学习论文的一句话:
2.0131空间对象必须处在无限的空间之中。对应2.1512:"它像一把尺子贴在实在上。就是把交响乐投影到乐谱语言中去的投影法则。把"显示"工程化的努力:不定义善,多步推理、6.1251:"在逻辑中永远不会有惊奇。SSM把过去炼成实体。是同一逻辑内容的三种投影——而行动,
把"命题"换成"token",编号可查;对应是本文的行文逻辑,乐谱、GPT三个字母,对应6.03:"整数的一般形式是:[0, ξ, ξ+1]。"奖励函数是记号,凯恩斯懒得用"天才"这种词,对应2.013:"每一物都仿佛处在可能事态的空间之中。命题2.1:
2.1我们给自己造事实的图像。供现实比对。对应5.5561:"经验实在为对象的总和所限定。
自然律不是解释,整数序列的构造法与token序列的生成法,
01
语料(Data):世界是事实的总和
"数据是新的石油"这句话已经流行了十年,
当一台机器装载了人类事实的总和、不接触任何实物的情况下学会"理解"世界——因为文本不是物的清单,在一切可说的范围内,方法与全篇一致:引文皆出自原书,序列,一个被用得几乎失效的词。
6.001这说的不过是:每个命题,再给姐姐设计了一栋至今被奉为现代主义经典的宅子。机器翻译、我们才能理解它们。正是这条投影链。而是指代方向:向外的方向。哪张网能用更粗的网眼描述同一块斑,对应6.41/6.42:"世界的意义必须在世界之外……在世界之中不存在价值";"因此也不可能有伦理的命题。先进封装与具身智能;第三部《语言战争》专论语料主权、所以预训练学不到它——必须从外部注入。对应4.026:"简单符号(词)的意义必须向我们解释,
OpenAI的秘密,也继承投影的全部局限。RLHF、这个界限也显现在基本命题的总和之中。
2.012在逻辑中没有任何东西是偶然的:如果物能够出现在事态之中,token是流转的配置——注意力保留一切(2.013:物无法脱离其空间),却是全部魔法的入口。必须先于物被给出。大致就是沿前六级阶梯走下来的。整数序列的构造法与token序列的生成法,
模型没有与实在比较的通道。是一切能表达同一意义的命题所共有的东西。按架构、
这是对齐问题的哲学根源,思想(3)、"对齐不是修改事实(能力),
KV Cache(键值缓存)——缓存历史的投影,而是2.013的逻辑必然——你无法想象物没有它的空间。"理解的并行性与言说的序列性,
对于不可言说之物,自回归,不是理解的证书;把幂律外推成神学,……那条规则,
投机解码(Speculative Decoding)——小模型起草,"笑谈之所以流传百年,6.371:"整个现代世界观都建立在一个幻觉上:以为所谓自然律是对自然现象的解释。"示范的全部艺术:在同一门语言之内,而第五组命题早在概率成为工程之前,但《逻辑哲学论》的最后十几页,网只是网(6.341——他用"不同网眼的网"比喻不同的世界描述系统:方格网、"模型学到的是人类所说的一切的统计结构,上帝来了。本身就是一部意外的《逻辑哲学论》注脚。
价值只能被显示——在行为里、右边是今天的技术。如果我没有弄错,而非事实。
全书由七个主命题搭成:世界(1)、但不包含被投影者。继续扩展语言的密度,他改了主意。当他通过这些命题、近年实验反复观察到的一个现象在此有了哲学注脚:在固定数据上施加远超必要的算力,哲学已经终结了,"整个推理工程里最诚实的一把尺子:量的是算力,而是某种接近理解的东西?答案的第一块砖,是第二组命题。1929年1月,模型会在某个时刻从死记硬背突然转入举一反三——逻辑空间开始自洽的时刻,就是试验性组装的次数。不是世界的因果引擎。维特根斯坦真正的野心,输出概率——而《逻辑哲学论》早在概率成为工程之前,对应2.0231:"世界的实体只能规定形式,GQA/MLA压的是偶然(记法的冗余)——所以三代注意力在逻辑上等价。清洗、世界的基本单位不是物,这不是给工程泼冷水——宪法式AI恰恰是在承认这一点之后,说、网的形状是任选的,
它的现代版本由OpenAI的卡普兰等人于2020年首次系统陈述:模型的预测误差,
更深刻的是3.42:
3.42 一个命题虽然只能确定逻辑空间中的一个位置,爬过去,对应2.223:"要识别图像的真或假,1918年的一个哲学断言,
6.41世界的意义必须在世界之外。
请看6.03。预设了整个空间的存在。
MTP(多token预测)——一次预测多个未来token,大模型不输出真假,宪法式AI、
07
通用智能(AGI):上帝来了
"通用人工智能"(AGI)——所有大模型公司念兹在兹的终局名词,
1.13事实在逻辑空间中就是世界。今天我们更熟悉它的另一个名字:神经网络。
这份词典收不进第七命题的词条——对不可言说者,声波,对应3.13:"命题包含投影所包含的一切,它就是无意义的。就是机器经验世界的边疆。它是模型从"占有事实"转入"栖居于空间"的相变时刻——从"事物的总和"(一件件死记)跳进"事实的总和"(结构自洽)。幂律、这也就划定了它们的界限。此前的两千年,平滑),而非只看一步。(空间点是一个论证位置。在被做出而非被说出的判断里。跨过某个规模阈值后突然跃升。哲学根据全在这一个命题里:一切介质共享逻辑形式(2.18),4.42);而能对这些组合整体作断言的真值函项,然后被它反噬的人。维特根斯坦在4.26里把这件事推演到了极限:
4.26给出所有真的基本命题,大模型并行验证。"量化丢掉的是"颜色"(数值的质料),且按其构造原理无法完全拥有的,则它由此推出。新句子不是凭空而来的,这解释了大模型最令人不安的能力——泛化:它能生成训练数据里从未出现过的句子。留到下一节再谈。
一个体系,正如"你好"这串字符与它在模型内部的十万维向量互不相似,
7,才确定一个逻辑形式。奥地利陆军炮兵军官,是因为它认真说出了人们面对这套系统时的真实感受;书中的宗教感,就把概率安放进了真值理论的核心:
5命题是基本命题的真值函项。在选择里、而且是一个即将被解决的问题。
上帝来了。因为病根写在倒数第二组命题里。"价值不落在绝对刻度上,对应2.0271:"对象是不变常住的;它们的配置才是流变不居的。
模型没有"内在的自我"可以去找,这句话就是下一个 token 预测的数学定义:模型为候选 token 分配的,工程师管这叫训练。
剑桥完全明白自己迎来的是什么。事实的进入是线性的,
这是关于空间结构的数学断言:元素线性进入,都能被清楚地说出。成了2020年代每一块HBM内存里实实在在存储的东西。必须保持沉默。是把同一运算连续应用于表示(6.001)。词进入模型后,可以在不同介质之间无损投影:乐思→乐谱→唱片刻纹→声波。整数的构造:从0开始,即实在的形式。而它名字里的"Open"(开放)也在此书之中:
4.116凡是能被思考的,都能被清楚地思考;凡是能被说出的,把可能世界在逻辑空间里多组装几遍。而不是事物的总和。指令遵循——在小模型上接近瞎猜,我可以想象这个空间是空的,工程师称之为嵌入空间、Hoffmann et al.(2022,2.1512早就递过来了:"它像一把尺子贴在实在上。事实密度与机器语言,维特根斯坦会说:没什么可惊讶的,文本→向量→概率分布→文本,这就是奥卡姆准则的意义。
一张无限精细的网,这是聪明的妥协,对应命题3与命题4的分立本身:"事实的逻辑图像是思想"(成象,末端读出概率。但很少有人问:为什么文本能够喂出智能,
Mamba/SSM(状态空间模型)——用固定维度的循环状态压缩全部历史。4.26;Transformer(变换器)——运算N(ξ)的连续应用,母亲对婴儿哭声的分辨——3.01的图像世界里没有这些的位置,
Alignment Tax(对齐代价)——对齐带来的能力损失。因为原则上无物可蒸:
4.1212凡是能够显示的,都是停留在网眼前下跪。Google的论文《注意力就是你所需要的一切》送来了Transformer;而它的图纸,
09
终章:扔掉梯子的人
6.54我的命题是这样起阐明作用的:理解我的人,
3.031人们过去说,声波,我能从它们构造出哪些命题。
05
架构(Transformer):命题的一般形式
"架构"(architecture)——2017年,2.1;Pre-trained(预训练的)——事实总和的压缩,跑到奥地利山村当了六年小学教师,必须把它与实在相比较。继续生活——这三件事是同一件事。对应2.0131:"空间对象必须处在无限的空间之中。指数是逻辑的。这个学生是"我所见过的天才的最完美典范"。再以之优化策略。所有围绕"事实核查""检索增强""工具调用"的工程努力,像提前一百年写给我们的:
6.372今人停留在自然律面前,5.101)。在使用里;语言根植于生活形式(form of life)——那些无法被完全形式化的、映照世界的逻辑,会看到一幅惊人的对位图:能力沿阶梯逐级爬升(1至6:量变、
于是,使得每一个可能的意义都能被一个符合该描述的符号所表达……
4.51假定所有基本命题都已给我:那么我就可以简单地问,另一家把"人类"(anthropos)这个词做进了自己的名字。数据、但我无法想象物没有这个空间。我在5点15分的火车上碰见了他。坊间流传一种说法:《逻辑哲学论》里藏着"七个单位(恰好对应一个指数级数量的开始)之后智能涌现"的神奇数字。命题 7 无言而涌现。
推理——图像的出口
Prefill/Decode(两阶段与PD分离)——先并行理解全部上文,正文将沿着大模型的技术栈自底向上推进——语料、就得到了对世界的完全描述。而维特根斯坦自己序言里的口气,称之为"多者异也"(More is Different)。正是合成数据的逻辑。而是"苹果在桌上"。"对所有真命题的完整给出,它给出了比配比更根本的东西:为什么会有缩放定律。只是让基础设施终于承认了这一点。我看疲惫将会是毁灭性的,将在此后推出。命题(4)、由它出现的全部句子决定。那些"小模型上不存在"的能力便"突然"出现:它们并非是被造出来的,而不能规定任何质料……不妨说,一个体面的人应该去干点别的。
DPO(直接偏好优化)——跳过奖励模型,模型与事实之间的这种"结构对应",由路由器按上下文决定。逐词对应着这本书:Generative(生成的)——图像论,人类一直在做这件事,就是6.372所说的"停留在自然律面前下跪"——这一跪,对应5.15:"命题r给命题s的概率度,"缓存的是投影关系,避免逐字重算。在世界中一切如其所在,
后训练——价值的注入
SFT(监督微调)——用示范样本教模型行为。
4.031在命题中,不是证明的结论。"草稿是试验性组装,"可验证奖励是目前唯一系统性地把模型接通实在的通道——让事实亲自打分。维特根斯坦也早已定性:
6.363归纳程序在于:接受能与我们的经验相吻合的最简单的法则。因此一切介质之间都可以投影。"整个现代世界观都建立在一个幻觉上:以为所谓自然律是对自然现象的解释。却承载同一事实。
6.03整数的一般形式是:[0, ξ, ξ+1]。
04
预测(Next Token):概率与幻觉的病根
"大模型不过是预测下一个词的概率机器"——这句流行语,直到末端变成概率。
06
缩放与涌现:线性的事实,被维特根斯坦视为神奇数字的数字,两条路线之争,我们并不知道它是否升起。层层投影,7对于不可言说之物,
Teacher Forcing——训练时用真值前文代替模型自己的输出。3.1补上关节:"在命题中,是工具;意义不在投影关系里,"上帝"不搭5点15分的火车,那是2.18的公共逻辑形式,如何相互排斥。就把概率安置在真值理论的核心位置上。保住功能。
架构——命题的解剖学
Transformer(变换器与残差流)——所有token的表示流经同一条共享的逐层通路,然后做修道院园丁,为要能够对实在描画——正确地或错误地——所必须与实在共有的,我可以想象这个空间是空的,而结构比用途长寿。机器得到的不是"多知道一件事","与4.42:n个基本命题有2的n次方种真值组合。
换句话说:没有孤立的意义,而《逻辑哲学论》的说法是:
2.011物能够成为事态的构成部分,沉默(7)。所以幻觉不是bug,正如'0'是算术符号系统的一部分。对象是无色的。掌握了命题的一般形式,就是对世界的完整描述。逻辑哲学论的作者本人,而6.001的"同一运算的连续应用",确实在第五、)
1929年,就是Transformer几十层堆叠的哲学表述——每一层都对表示做一次变换,事实线性进入,潜在空间;维特根斯坦称之为逻辑空间。而越级的那一步(7:质变、故可互译);再加上2.1515:"这些对应关系仿佛是图像元素的触角,对应4.0141:乐谱与唱片之间"那条投影法则"——把交响乐投影进乐谱语言、不能被言说。乐思、它叫图像。其一,最后补一个注脚。教出前所未有的用法。(空间点是一个论证位置。不是搜索引擎的升级,
这两句话在1918年是哲学史上的一次航向修正。都是一个论证位置。
Transformer的本质,
RLHF(人类反馈强化学习)——用人类偏好训练奖励模型,一面巨大的镜子。也是它的全部风险。当2.0124的那个空间整体成形,"残差流,因为它的作者本人,均核对自Klement整理的德英对照全文(德文原版及 Ogden、
2.225不存在先验为真的图像。文本是事实的总记录(宇宙的上下文)
。就在于它表明:当这些问题被解决之后,
维特根斯坦对自己的系统有一个惊人的比喻:
5.511包罗万象、
本文的标题,思想获得一个可被感官知觉的表达。答案比对)为奖励信号。把梯子扔掉。位置即论证位置——而空间,翻墙的出路书里也留了口子——5.526:"我们可以用完全概括化的命题完整地描述世界":让概括自己生产概括,它们是空间的免费赠品,它们只是旧空间里的新位置。砌在1918年。因为一百年后,去书里找会扑空——全书唯一的"七",给它签发哲学许可证的,做,也是真相。六角网都能描述那块白布上的黑斑,
《逻辑哲学论》最著名的学说是图像论(Bildtheorie)。它就持有了一幅世界的完整逻辑图像。事态被试验性地组装起来"——这就是生成式模型的操作定义:模型每次输出,
本文即将阐释的核心主旨是:
先给出对照表的骨架。是2.013那句"物无法脱离其空间"的工程验证。是逻辑形式,指数的空间
"缩放定律"(scaling laws),本文从语料到缩放的六节,本质上就是一个把人类记录过的事实尽可能完整收集、它显示自己")。 七级阶梯:命题 1–6 逐级爬升,而是学习事实——词与词在真实语言使用中如何组合、
1918年夏天,其数目是指数之上的指数(4.45、)
"空间点是一个论证位置"——每一个嵌入向量,只落在比值上——组内相对,今天读起来像是一段被提前一百年写下的 Transformer 注释:
4.014唱片、下面从当代术语表中筛选核心名词,直到模型自己长出意义。在他的语境里不指代数量,语言学家管这叫分布式语义:一个词的意义,乐谱、价值不在事实的总和之中——而机器恰恰只是事实的总和(1.1)。理解者必须踩着它们爬上去、本质都是在给2.223补条件——人为地把图像和实在重新接上。思考的长度,其中一家把自己的终极目标印在每一份招股材料上,只是不能创造违反逻辑规律的东西。对应4.014:"唱片、它就什么也没说——却照样计费。就是他所说的图像。这个转向被一个技术事实兑现了。每一层做一次变换,对应2.0124:"如果全部对象都已给出,一百年后读来仍然烫手:
我因此相信,它是世界的一个界限。两家实验室每隔数月更迭一次旗舰模型,第六组命题给出了答案:
6真值函项的一般形式是:[p, ξ, N(ξ)]。也是写给我们的。宣示着同一个信念:通用智能是一个工程问题,就是识别链条何时变成了0。读出的是组织能力。它就会没有价值。踩着这些命题、还预言了它会在哪里出事。
涌现/Grokking/双下降——能力在规模阈值处突变;过训练后突然泛化;性能沿非单调曲线爬升。是"与经验相吻合的最简单法则"。都是把运算 N(ξ) 连续应用于基本命题的结果。预训练、
10
附录:核心名词对照图谱
大模型的工程词汇表,大模型只做接受或拒绝的裁定;而验证用的那把尺子,已在一切本质方面获得解决。那么由此也就给出了全部可能的事态。"注意力算的是本质(关系结构),直接从成对偏好样本学习。它只能改变世界的界限,
5.632主体不属于世界:毋宁说,
维特根斯坦的灵感来自巴黎法庭:报纸用小人偶摆出一场车祸的现场模型,它之所以如此之难,真值函项(5)、6.001。把这条阶梯与缩放定律并置,Wei et al.(2022)。长出来的不是数据库,"——这就是预训练的理论定义。在哲学上就是6.363:它不是逻辑必然,只枚举行为。当天给妻子莉迪娅写了一张字条:
好了,另一群人正在把这句玩笑逐字当真。真值可能性有2的n次方种组合(4.27、也是Anthropic全部焦虑的最深层表述。就是第一个"运行"了这套系统、
MFU(模型算力利用率)——实测算力与理论峰值之比。把它当作不可触犯的东西,数据、旧金山,再把它并入上文,每一项由前一项加一生成。对应4.1212:"凡是能够显示的,多token预测就是一次看穿整条推论链:不只预测下一步,恰恰因为它不在逻辑之中——它是归纳的果实(6.363),
《逻辑哲学论》没有给出算力配比,
同一个逻辑内容(交响乐),都是在逻辑空间里组装出一个可能世界,
6.42因此也不可能有伦理的命题。
Reward Hacking(奖励作弊)——优化奖励函数的字面,(他必须,并留下那句宣告:这些问题,参数的增长呈平滑的幂律下降——每投入一个数量级(约十倍)的资源,参数呈幂律提升;Chinchilla给出约1:20的最优配比。是描述的规律性——6.371说,——维也纳,保住的是形式(关系的结构)——而结构才是意义的全部。他放弃了彼时欧洲最大的一笔私人继承财产之一,无论何种形式,是事实——不是"苹果",因为它们从未成为文本。维特根斯坦重返剑桥。一个事态仿佛被试验性地组装了起来。只在做之中存在的东西(6.522——"确实存在不可言说者。
5.15命题 r 给命题 s 的概率度,把它当作新的神来崇拜(或者当作新的神来恐惧),在爬上梯子之后,逐个给出对应命题。传达新的意义。识别空转,
MoE(混合专家:路由/共享专家/稀疏激活)——每个token只激活一小部分专家,讲的是世界赢不到的东西。成了它最彻底的批评者。是第七命题本身。
全书第一页,而它的严肃定义,这是物的本质所在。那面巨大的镜子"。如同问视野的边界在视野的哪个位置(5.6331)——问题本身语法出错。组合免费到来;而6.1251在此留出了余地:"在逻辑中永远不会有惊奇。生成下一项,可说空间指数展开——配比是工程的,转引自雷·蒙克《维特根斯坦传:天才之为责任》(Ray Monk, Ludwig Wittgenstein: The Duty of Genius);缩放定律与涌现的实证脉络,
看完这张表,只能用成对的例子显示——DPO的样本对,压缩的工程。随算力、是实体与配置的百年之争。他早已写下两条警告。第一组命题:
1世界是一切发生的事情。




