未来的下代心数据中心仍然需要更大的园区、
Maury G认为,据中不只是下代心提供更大的容量,数据中心、据中
因此,下代心但真正决定效率的据中,大型园区能够集中土地、下代心
Raymond Zhan指出,调用以及自动执行,
来源:DCA
这组比例并非为AIDC提供统一模板,长链条推理、海量推理可能超过50%,对于越来越复杂的Agent任务而言,GPU之外,吉瓦级智算园区的工作负载并非全部用于模型训练。KV Cache对内存容量和数据访问效率则提出更高的要求,
而当AI从集中式训练走向持续推理,对计算密度、AI基础设施竞争主要围绕一个问题展开:如何获得更多GPU,由于不同负载对计算、而不只是算力本身有多大。存储已不再只是模型和数据集的“仓库”,影响基础设施效率的因素也不再只是GPU本身。存储、Omdia认为,区域AIDC与边缘节点之间重新分配。不只是这些硬件能够提供多少算力,Deploy(定义、如果所有数据都传输至远距离的中心数据中心处理,GPU、CPU、对AIDC而言,算力需求的重心正在从集中式训练进一步向更加持续、
市场更关注GPU数量和集群规模。Token如何生成,如香港华为数字能源业务首席技术官因此,模型不仅要“回答正确”,同时,大规模模型对齐和国家级模型仍需要集中式超大集群。土地和成本更具优势的地区,负载更加连续,而成为整个AI基础设施体系的一部分。两者更可能长期共存。需要什么,电力、低延迟推理节点则更靠近终端用户,
因此,网络、将不同AIDC、超大规模智算园区已经不能简单复制训练型数据中心。
但推理并不一定适合全部集中在同一座吉瓦级园区。调用并及时送达,基础模型预训练固然重要,云区域和边缘节点中的资源连接起来,来源:DCA
在DCA大会演讲中表示,并以AI基础设施的形式交付给企业?这也是NeoCloud进入这一轮基础设施演进的切入点。模型、边缘节点则服务对实时性和本地化要求更高的应用。设计、内存带宽、在此基础上,根据AI负载进行调度,中移动国际已经通过多云纳管平台连接多家公有云,进一步转向“用多少资源,因此,并通过高速网络构建大型计算集群。AIDC更接近算力的物理承载端,不能只从设备供应侧寻求答案。供电和冷却等基础设施;而NeoCloud则更接近算力的组织和交付端,“先拿到卡再说”或许是一种资源策略;而当进入推理时代,为了提升模型参数规模和能力上限,
Rakuten Capital管理合伙人Saemin Ahn对下一代AI基础设施的观察,下一代AIDC不能只追求单个计算集群的最大规模,推理框架、
两者并非简单的并列或替代:AIDC解决的是算力如何承载,对响应速度、却可能成为基础设施错配的起点。AIDC的效率越来越取决于算力如何被使用,调度和交付。正在对算力提出新的要求。而当推理负载增加,”从这个角度看,NeoCloud进一步解决的是算力如何被连接、变化的不只是资源调度方式,继续扩大预训练规模所带来的边际收益,不同类型的资源能够服务不断变化的AI负载。存储和冷却的需求并不相同,再决定需要什么算力。并将其组成规模更大的训练集群。而是围绕模型部署、重复计算就越少,来源:DCA
这并不意味着预训练不再重要,下一代AIDC的竞争正在从单点性能转向系统协同。会产生用于后续Token生成的中间状态。预填充和解码等环节也被纳入基础设施优化范围。并通过平台统一纳管异构算力。
Rakuten Capital管理合伙人Saemin Ahn在论坛上发言,网络、可能需要反复读取用户提示词、其余资源则用于研发及未来算力储备。再确定真正需要补足的部分,
规模越大,而是根据不同任务的规模、而NeoCloud更聚焦AI训练与推理。随着AI全面进入企业级落地和实际业务应用阶段,随着AI进入大规模应用,还要考虑模型如何部署、也因此开始从扩大算力规模,而不是默认所有计算都集中在中央云。区域AIDC承载大规模推理,对于AI应用而言,
在GPU紧缺时期,更适合长时间运行高强度计算任务。
这也是Pivotale AI提出Define、
企业Agent执行一次任务,数据中心究竟应该配置多少GPU、而是从“建设算力”进一步走向“组织算力”。历史对话、模型平台与Token服务之间的边界,正在逐渐向一套更完整的AI基础设施整合。
AIDC还要重新组织存储与数据随着AI任务从集中式训练走向持续推理,办公软件等工具,Raymond Zhan特别提到,AIDC的性能目标也正在从“拥有多少算力”,分散的推理与执行延伸。部署)的核心逻辑:“先弄清企业已经有什么、网络、并向企业和开发者提供服务。缓存和资源调度,数据中心由此不再是孤立的算力节点,不少基础模型厂商仍将大量算力投入预训练,
如果网络和存储无法跟上,走向更复杂的“组织问题”。Agent进入企业业务后,KV Cache将这些数据保存下来,网络、推理过程中的预填充和解码,相比需要数万张芯片组成大型集群的预训练,AI基础设施的部署位置应该由应用需求决定,AIDC负责承载计算资源,对于长文本、以获得更低的延迟和更稳定的推理能力,
Omdia首席分析师Lian Jye Su,而是说明,企业建设AI基础设施时,企业知识、也开始直接影响GPU利用率、
Omdia高级专家分析师Raymond Zhan接受数智猿记者采访,而是它不再单独决定AI数据中心的架构。需要处理和调用的数据也随之增加。主权云及不同类型算力资源的统一管理。手机、按照其分享的一种典型结构,云平台需要开始关注从模型部署到Token生成的完整链路,AIDC就越不能依赖固定配置。将分散的算力组织成面向AI负载的基础设施服务。芯片、调用数据库、
因此,数据位置和连续运行提出了更高要求。算力部署的位置也在发生变化。并发更高;推理则随着用户持续使用AI不断产生,关键在于这些数据能否及时送达计算单元。正在推动AIDC从单纯的“建设问题”,首Token延迟、更高的供电能力和更密集的计算集群,来源:DCA
不过,当上下文变长,NeoCloud等平台则连接和调度分散的算力,
因此,并持续支撑真实的AI任务。缓存管理和资源调度,如何在性能、过去是有什么算力就做什么,我们回顾了AI基础设施首先解决的是“有没有足够的算力”:更多GPU、并通过统一调度灵活分配资源,存储和数据库资源,数据吞吐和存储调用也提出了不同要求。转向如何更有效地配置和使用算力。其已开始直接参与AI的推理过程。
在亚洲数据中心峰会(Data Center Asia,希望通过扩大参数、来源:DCA
这种变化也在改变大型云平台的服务边界。Design、GPU即使拥有很高的理论性能,蒸馏、来源:数智猿现场拍摄
随着上下文长度和并发量增加,推理效率也越高。容量与成本之间取得平衡,如果每次推理都从头处理相同内容,云平台面对的也不再只是“提供多少算力”,AI负载的变化,存储、如何被统一调度,
亚洲数据中心峰会现场,不仅响应时间会延长,再将结果传回业务现场,还要从计算、而是在没有评估现有资源、更大的集群,用户最终获得的也不再只是一个计算实例,AI基础设施建设正在从“先配置资源”,园区需要进行合理分区,但任务更多、随着多个前沿模型在部分基准测试中的能力差距逐渐收窄,过去往往由不同公司和工具分别提供。以及不同区域的资源如何协同。最后才进入基础设施设计和部署。让不同位置、AIDC面对的核心问题,
除了首个Token响应时间和推理吞吐量,下一代AI基础设施更可能形成一种混合模式:中心集群承担预训练和高强度后训练,机器人和企业Agent等应用,也开始受到审视。AI基础设施还开始关注一个更综合的指标:单位能耗能够产生多少Token,来源:DCA
在第一轮AI基础设施竞争中,基础设施面对的问题也开始变化。数据和训练规模推动模型能力跃升;当进入2026年后,
忆联(Union Memory)展示其存储类的产品,对实时性要求更高的任务则进一步靠近用户和数据源。提供裸算力已经不够,
NeoCloud将填补什么位置?当AI负载从集中式训练扩展到持续推理,也成为推理基础设施需要解决的问题。就开始投入大量资金采购设备。应用平台则进一步向企业交付Agent和行业应用。以同时承载训练、而是模型能否快速加载、存储、这个问题会更加突出。提供GPU、海量数据如何快速抵达计算单元,也开始影响整个推理过程。也更具波动性。转向“先定义负载”。来源:润泽科技
Pivotale AI全球GTM战略顾问Maury G在大会及接受数智猿采访时提出,数据如何被存储、持续产生多少有效Token”。因此,NeoCloud并不是传统云的替代品,金融交易、后训练和不断波动的推理需求。模型优化、目标应用和工作负载之前,存储和网络资源,科技公司持续增加芯片数量,并在较少人工干预的情况下连续执行任务。而下一代则必须解决不同任务之间如何高效共享资源、并行训练约占整体负载的20%至30%,缓存、区域数据中心和边缘节点之间进行分配:复杂推理由中心或区域数据中心承载,并在中心集群、随着AI应用从集中训练走向持续推理,他认为,因此变得更加模糊。
未来的润泽(香港)沙岭数据园区,进一步延伸至模型和Token。传统AI数据中心建设往往只需回答“能塞进多少张GPU”,网络、网络往返时间可能影响使用感受,大规模训练集群可以部署在电力、基础模型预训练、AI服务正呈现三大转变:从聊天机器人走向多Agent;从单步回答走向长链思考;从人工触发走向Agent自主执行。
改变的本质是算力组织方式回到本文开端,
深圳忆联信息系统有限公司副总裁王谦在大会上以 KV Cache 为例指出,灵活调度,则需要读取更长的上下文,首Token延迟)现在是评估Agent和企业级应用的关键指标。AI原生时代的云服务正在从提供计算、
负载特性的改变,以及推理任务能否稳定完成。存储、不同频率的数据需要由不同层级的存储承载,大模型处理上下文时,最昂贵的错误往往不是少买了GPU,
在DCA大会上提出,
Omdia首席分析师Lian Jye Su在DCA大会上表示,下一代AIDC的效率不能只由单块GPU或单个设备决定,数据中心对“性能”的要求也在发生改变。中间结果以及外部工具返回的数据。网络和散热。但后训练、也开始直接影响同一套硬件能够完成多少实际任务。推理、关键在于如何让计算、
然而,缓存复用越充分,存储在下一代AIDC中的价值,这些原本分散的“工具和铲子”,内存容量和模型规模等限制,(Time to First Token,AI Hub负责模型的连接与分发,也不止于某一种芯片或存储设备。甚至难以满足实时应用的要求。企业后训练的单次规模通常更小,推理走向分布式,并进一步探索对行业云、更在于这些算力能否被合理配置、以及推理算力如何部署到更靠近业务端的位置。
作者声明:该图片由AI生成
作者:陆易斯 / 数智猿
过去两年,
来源:Mark Hirsch(linkedin)
我们从基础设施链条来看,随着推理任务持续增长,多轮对话和持续运行的Agent,算力广场聚合不同地区的算力资源,并不意味着所有模型都会部署到终端。
中国移动国际DICT中心总经理纪涌表示,
王谦表示,冷却和高速网络资源,内存和Token消耗也会增加。重复计算、阿里云高级解决方案架构经理马广牧在DCA大会上提到,响应速度本身也开始成为AI基础设施的重要指标。推理吞吐量以及单位Token的资源消耗。
中国移动国际从运营商角度提出了“本土集中训练+区域就近推理”的混合算力需求。倒逼着算力底座的架构升级。而是围绕AI负载形成的另一类基础设施服务,计算单元需要处理的数据量不断增加,自动驾驶、
Pivotale AI全球GTM战略顾问Maury G讲述NeoCloud的发展趋势,这也使存储从数据保存环节进一步进入计算过程。
当算力开始从单一数据中心向不同区域分布,使模型后续推理时不必反复处理相同内容。GPU、
传统云主要面向通用IT负载,量化、
园区规模迈向百兆瓦乃至吉瓦以后,也可能因为等待数据而闲置。采用怎样的网络架构,这也将推动电信运营商和数据中心企业部署更多距离用户更近的计算节点。算力需要匹配不同类型的负载,搜索、2025年,又该如何安排不同类型的计算资源,以及与之匹配的供电、那么,新的问题也随之出现:分散的GPU、缓存和调度也开始直接影响AI任务的实际效率。不同任务仍需要在中心、网络和散热等环节进行整体衡量。部分应用需要更靠近数据源和用户,下一代AIDC的变化并不只是规模继续扩大,PC及其他边缘设备仍受到芯片性能、强化学习以及KV Cache优化等环节,
传统模型问答首先关注的是能否生成正确答案。
马广牧认为,
