据官方介绍,元脑SD200Ultra基于国产AI芯片打造,单机可承载运行2.8万亿参数的KimiK3大模型。浪潮表示,SD200Ultra的Token生成时延首次降至5.85毫秒以内,相当于单用户速度170Tokens/s,达到业界平均水平的5倍。该机型支持10万亿参数规模前沿模型单机运行。亚汇网注:Token生成时延指大模型每输出一个词元所需的平均时间,是衡量推理响应速度的核心指标之一。SD200Ultra采用3DHyperMesh架构,紧耦合128芯本土AI芯片,提供8TB统一编址显存和64TB内存。系统采用原生内存语义通信,通信时延低至0.69微秒。该超节点通过全局统一编址、虚拟影子设备映射、跨域地址翻译与路由,实现GPU跨主机域的统一寻址访问,构建百纳秒级低时延内存语义互连域。浪潮称,借助对称内存技术,SD200Ultra首次在基于本土AI芯片的超节点上实现GPU显存直连,使GPU可直接访问远端GPU显存。AllReduce通信时间降低3.5倍。针对KimiK3推理,SD200Ultra使用KimiK3构建超级算子智能体,实现通算融合、Tile级流水的超级算子,将KDA、GatedMLA、MoE中的基础算子融合。算子数量降低10倍,推理性能提升3倍以上。浪潮同日发布元脑HC2000多元算力机组。该机组采用DirectCom2.0极速架构,基于高密液冷AI整机柜,搭配MCIS推理软件栈,可动态匹配计算负载。官方称同等投资下Token产能提升10倍。浪潮将Agent时代AI计算分为两个方向:CapabilityAICompute能力型智算,支撑突破智能上限;CapacityAICompute容量型智算,实现智能充分供给。浪潮称,前沿模型参数规模已从DeepSeekR1的6710亿增长到KimiK3的2.8万亿,并走向10万亿级;上下文从128K扩展到1M以上;Agent从单体走向成百上千个协同。模型权重、KVCache(键值缓存,用于存储注意力机制中的键和值,减少重复计算)和并发任务规模同步增长,对显存容量、高速互连和并行扩展效率提出更高要求。复杂Agent任务包含大量“推理—工具调用—反馈—重新规划”循环,每轮时延都会累积。浪潮信息称,时延已不只是体验指标,可能影响任务能否及时完成。复杂Agent任务需连续运行数小时甚至数天,期间经历大量模型调用、工具调用和数据交互。任何计算、通信或软件故障都可能中断任务。
免责声明:本文章仅代表作者个人观点,不代表亚汇网立场,亚汇网仅提供信息展示平台。
更多行情分析及广告投放合作加微信: hollowandy