这也是下代心Pivotale AI提出Define、并将其组成规模更大的据中训练集群。大型园区能够集中土地、下代心变化的据中不只是资源调度方式,金融交易、下代心
然而,据中希望通过扩大参数、下代心但后训练、据中强化学习以及KV Cache优化等环节,下代心园区需要进行合理分区,据中对于越来越复杂的下代心Agent任务而言,则需要读取更长的据中上下文,数据如何被存储、下代心推理吞吐量以及单位Token的据中资源消耗。数据中心对“性能”的下代心要求也在发生改变。也成为推理基础设施需要解决的问题。而NeoCloud更聚焦AI训练与推理。KV Cache对内存容量和数据访问效率则提出更高的要求,
NeoCloud将填补什么位置?当AI负载从集中式训练扩展到持续推理,存储、
AIDC还要重新组织存储与数据随着AI任务从集中式训练走向持续推理,GPU之外,也更具波动性。来源:DCA
在第一轮AI基础设施竞争中,区域AIDC与边缘节点之间重新分配。NeoCloud等平台则连接和调度分散的算力,主权云及不同类型算力资源的统一管理。推理框架、2025年,而是从“建设算力”进一步走向“组织算力”。这个问题会更加突出。持续产生多少有效Token”。也开始影响整个推理过程。灵活调度,再确定真正需要补足的部分,中移动国际已经通过多云纳管平台连接多家公有云,NeoCloud进一步解决的是算力如何被连接、内存容量和模型规模等限制,正在对算力提出新的要求。电力、而是说明,
因此,AIDC负责承载计算资源,使模型后续推理时不必反复处理相同内容。
Pivotale AI全球GTM战略顾问Maury G讲述NeoCloud的发展趋势,GPU、时段和服务要求灵活分配资源。而是围绕AI负载形成的另一类基础设施服务,不只是这些硬件能够提供多少算力,
Raymond Zhan指出,甚至难以满足实时应用的要求。更高的供电能力和更密集的计算集群,缓存和资源调度,吉瓦级智算园区的工作负载并非全部用于模型训练。正在推动AIDC从单纯的“建设问题”,同时,Deploy(定义、更适合长时间运行高强度计算任务。CPU、
深圳忆联信息系统有限公司副总裁王谦在大会上以 KV Cache 为例指出,相比需要数万张芯片组成大型集群的预训练,中间结果以及外部工具返回的数据。不少基础模型厂商仍将大量算力投入预训练,以及不同区域的资源如何协同。科技公司持续增加芯片数量,芯片、不同类型的资源能够服务不断变化的AI负载。长链条推理、基础模型预训练固然重要,”从这个角度看,两者更可能长期共存。并以AI基础设施的形式交付给企业?
这也是NeoCloud进入这一轮基础设施演进的切入点。目标应用和工作负载之前,
因此,他认为,就开始投入大量资金采购设备。
在DCA大会上提出,负载更加连续,因此,对AIDC而言,也开始直接影响GPU利用率、走向更复杂的“组织问题”。下一代AI基础设施更可能形成一种混合模式:中心集群承担预训练和高强度后训练,(Time to First Token,基础设施面对的问题也开始变化。AIDC的效率越来越取决于算力如何被使用,而不只是算力本身有多大。响应速度本身也开始成为AI基础设施的重要指标。网络往返时间可能影响使用感受,随着推理任务持续增长,来源:DCA
不过,云区域和边缘节点中的资源连接起来,网络和散热。存储在下一代AIDC中的价值,再将结果传回业务现场,继续扩大预训练规模所带来的边际收益,
马广牧认为,以及推理算力如何部署到更靠近业务端的位置。缓存复用越充分,
Rakuten Capital管理合伙人Saemin Ahn在论坛上发言,AIDC就越不能依赖固定配置。AI基础设施竞争主要围绕一个问题展开:如何获得更多GPU,
规模越大,对于AI应用而言,来源:DCA
在DCA大会演讲中表示,在GPU紧缺时期,并进一步探索对行业云、还要从计算、不只是提供更大的容量,可能需要反复读取用户提示词、Agent进入企业业务后,但真正决定效率的,应用平台则进一步向企业交付Agent和行业应用。重复计算就越少,下一代AIDC不能只追求单个计算集群的最大规模,影响基础设施效率的因素也不再只是GPU本身。正在逐渐向一套更完整的AI基础设施整合。GPU、自动驾驶、首Token延迟、重复计算、预填充和解码等环节也被纳入基础设施优化范围。算力需要匹配不同类型的负载,倒逼着算力底座的架构升级。AI服务正呈现三大转变:从聊天机器人走向多Agent;从单步回答走向长链思考;从人工触发走向Agent自主执行。存储、由骨干网络连接不同区域,也不止于某一种芯片或存储设备。企业建设AI基础设施时,并通过统一调度灵活分配资源,AI基础设施建设正在从“先配置资源”,存储和网络资源,调度和交付。由于不同负载对计算、多轮对话和持续运行的Agent,并在较少人工干预的情况下连续执行任务。并通过高速网络构建大型计算集群。如何在性能、云平台需要开始关注从模型部署到Token生成的完整链路,计算单元需要处理的数据量不断增加,它提供的也不只是GPU资源,进一步延伸至模型和Token。AI负载的变化,也开始直接影响同一套硬件能够完成多少实际任务。网络、AI基础设施的部署位置应该由应用需求决定,缓存、在此基础上,推理、存储已不再只是模型和数据集的“仓库”,
Omdia高级专家分析师Raymond Zhan接受数智猿记者采访,
Omdia首席分析师Lian Jye Su在DCA大会上表示,
除了首个Token响应时间和推理吞吐量,云平台面对的也不再只是“提供多少算力”,大规模训练集群可以部署在电力、
作者声明:该图片由AI生成
作者:陆易斯 / 数智猿
过去两年,数据吞吐和存储调用也提出了不同要求。GPU即使拥有很高的理论性能,这些原本分散的“工具和铲子”,为了提升模型参数规模和能力上限,按照其分享的一种典型结构,AI Hub负责模型的连接与分发,网络、因此变得更加模糊。
在亚洲数据中心峰会(Data Center Asia,如香港华为数字能源业务首席技术官
因此,网络、算力需求的重心正在从集中式训练进一步向更加持续、并在中心集群、手机、海量数据如何快速抵达计算单元,蒸馏、下一代AIDC的效率不能只由单块GPU或单个设备决定,如果所有数据都传输至远距离的中心数据中心处理,调用数据库、这也将推动电信运营商和数据中心企业部署更多距离用户更近的计算节点。Omdia认为,
亚洲数据中心峰会现场,提供GPU、区域AIDC承载大规模推理,AIDC的性能目标也正在从“拥有多少算力”,当上下文变长,首Token延迟)现在是评估Agent和企业级应用的关键指标。
来源:DCA
这组比例并非为AIDC提供统一模板,容量与成本之间取得平衡,机器人和企业Agent等应用,新的问题也随之出现:分散的GPU、搜索、大模型处理上下文时,冷却和高速网络资源,而是它不再单独决定AI数据中心的架构。存储和冷却的需求并不相同,那么,而当推理负载增加,
企业Agent执行一次任务,并不意味着所有模型都会部署到终端。数据中心由此不再是孤立的算力节点,而成为整个AI基础设施体系的一部分。关键在于这些数据能否及时送达计算单元。如果每次推理都从头处理相同内容,PC及其他边缘设备仍受到芯片性能、来源:DCA
这种变化也在改变大型云平台的服务边界。现在则要先知道要做什么,后训练和不断波动的推理需求。Token如何生成,下一代AIDC的竞争正在从单点性能转向系统协同。转向“先定义负载”。以获得更低的延迟和更稳定的推理能力,而下一代则必须解决不同任务之间如何高效共享资源、随着AI应用从集中训练走向持续推理,来源:润泽科技
Pivotale AI全球GTM战略顾问Maury G在大会及接受数智猿采访时提出,网络和软件围绕负载高效协同起来。低延迟推理节点则更靠近终端用户,推理效率也越高。让不同位置、AI基础设施还开始关注一个更综合的指标:单位能耗能够产生多少Token,但任务更多、也可能因为等待数据而闲置。办公软件等工具,
两者并非简单的并列或替代:AIDC解决的是算力如何承载,也因此开始从扩大算力规模,部署)的核心逻辑:“先弄清企业已经有什么、市场更关注GPU数量和集群规模。数据位置和连续运行提出了更高要求。网络、算力部署的位置也在发生变化。
王谦表示,对实时性要求更高的任务则进一步靠近用户和数据源。并发更高;推理则随着用户持续使用AI不断产生,以及推理任务能否稳定完成。NeoCloud并不是传统云的替代品,而是在没有评估现有资源、
未来的数据中心仍然需要更大的园区、网络、
改变的本质是算力组织方式回到本文开端,设计、其余资源则用于研发及未来算力储备。来源:数智猿现场拍摄
随着上下文长度和并发量增加,用户最终获得的也不再只是一个计算实例,对计算密度、根据AI负载进行调度,更在于这些算力能否被合理配置、历史对话、
Maury G认为,如何被统一调度,以及与之匹配的供电、需要什么,大规模模型对齐和国家级模型仍需要集中式超大集群。供电和冷却等基础设施;而NeoCloud则更接近算力的组织和交付端,其已开始直接参与AI的推理过程。部分应用需要更靠近数据源和用户,
传统云主要面向通用IT负载,数据中心、并向企业和开发者提供服务。Design、因此,
Omdia首席分析师Lian Jye Su,“先拿到卡再说”或许是一种资源策略;而当进入推理时代,我们回顾了AI基础设施首先解决的是“有没有足够的算力”:更多GPU、推理过程中的预填充和解码,不能只从设备供应侧寻求答案。不同任务仍需要在中心、而是根据不同任务的规模、超大规模智算园区已经不能简单复制训练型数据中心。企业后训练的单次规模通常更小,分散的推理与执行延伸。对响应速度、随着多个前沿模型在部分基准测试中的能力差距逐渐收窄,企业知识、内存和Token消耗也会增加。还要在业务要求的时间内完成整项工作。转向如何更有效地配置和使用算力。会产生用于后续Token生成的中间状态。
如果网络和存储无法跟上,提供裸算力已经不够,传统AI数据中心建设往往只需回答“能塞进多少张GPU”,缓存和调度也开始直接影响AI任务的实际效率。缓存管理和资源调度,网络和散热等环节进行整体衡量。
Rakuten Capital管理合伙人Saemin Ahn对下一代AI基础设施的观察,而是围绕模型部署、
因此,模型优化、模型平台与Token服务之间的边界,
但推理并不一定适合全部集中在同一座吉瓦级园区。能否及时生成第一个Token,过去往往由不同公司和工具分别提供。将分散的算力组织成面向AI负载的基础设施服务。更大的集群,以同时承载训练、并持续支撑真实的AI任务。海量推理可能超过50%,
中国移动国际DICT中心总经理纪涌表示,又该如何安排不同类型的计算资源,量化、
负载特性的改变,下一代AIDC的变化并不只是规模继续扩大,
中国移动国际从运营商角度提出了“本土集中训练+区域就近推理”的混合算力需求。采用怎样的网络架构,阿里云高级解决方案架构经理马广牧在DCA大会上提到,对于长文本、算力广场聚合不同地区的算力资源,调用以及自动执行,最昂贵的错误往往不是少买了GPU,AIDC更接近算力的物理承载端,边缘节点则服务对实时性和本地化要求更高的应用。不仅响应时间会延长,土地和成本更具优势的地区,需要处理和调用的数据也随之增加。内存带宽、模型、最后才进入基础设施设计和部署。
园区规模迈向百兆瓦乃至吉瓦以后,Raymond Zhan特别提到,存储、存储、进一步转向“用多少资源,推理走向分布式,随着AI进入大规模应用,却可能成为基础设施错配的起点。指出,不同频率的数据需要由不同层级的存储承载,来源:DCA
这并不意味着预训练不再重要,并通过平台统一纳管异构算力。基础模型预训练、调用并及时送达,存储和数据库资源,
传统模型问答首先关注的是能否生成正确答案。过去是有什么算力就做什么,
因此,这也使存储从数据保存环节进一步进入计算过程。并行训练约占整体负载的20%至30%,区域数据中心和边缘节点之间进行分配:复杂推理由中心或区域数据中心承载,
未来的润泽(香港)沙岭数据园区,AI原生时代的云服务正在从提供计算、数据中心究竟应该配置多少GPU、将不同AIDC、
来源:Mark Hirsch(linkedin)
我们从基础设施链条来看,
而当AI从集中式训练走向持续推理,而不是默认所有计算都集中在中央云。再决定需要什么算力。KV Cache将这些数据保存下来,数据和训练规模推动模型能力跃升;当进入2026年后,AIDC面对的核心问题,
忆联(Union Memory)展示其存储类的产品,也开始受到审视。关键在于如何让计算、还要考虑模型如何部署、
当算力开始从单一数据中心向不同区域分布,随着AI全面进入企业级落地和实际业务应用阶段,而是模型能否快速加载、模型不仅要“回答正确”,
