不靠英伟达网卡,国产GPU直通方案实测出炉:吞吐飙升、延迟砍半
AI 深度解读
背景
当前国产AI算力面临的核心困境并非单芯片性能落后,而是“单点强、系统弱”的结构性失衡。各家芯片厂商在片内、片间、网间、集群间的互联各成体系,缺乏统一的全栈视角与系统级协同,导致算力资源被严重碎片化,系统级性能无法随芯片数量线性释放。在大模型训练与推理需求被训练侧Scaling Law、推理侧test-time scaling以及Agent应用爆发三条指数曲线同时驱动的背景下,互联技术正从配角跃升为决定系统效能的核心命脉。
2026年7月17日至20日,世界人工智能大会暨人工智能全球治理高级别会议(WAIC 2026)在上海世博、张江、西岸“三地四馆”同步举行。作为AI网络全栈式互联产品及解决方案提供商,奇异摩尔首次亮相WAIC,并举办“智联为擎 合一共进——AI网络前沿生态论坛”,联合上海人工智能实验室、香港科技大学(广州)、商汤科技、壁仞科技、九章云极、曦望科技、科华云、图灵量子、图灵芯擎等研究机构与企业,共同探讨国产算力互联生态的协同创新。
核心内容
奇异摩尔在WAIC 2026上集中展示了多项核心技术突破,覆盖从片内互联、超节点XPU间互联(Scale-Up)到网间互联(Scale-Out)及下一代光互联的全栈式解决方案。
国产化超节点互联全栈解决方案首次亮相
奇异摩尔以超节点机柜形式直观呈现了国产AI算力基础设施从“单点芯片突破”迈向“系统级协同优化”的跨越式发展。该方案覆盖Scale-Out网间互联、Scale-Up超节点XPU间互联到下一代光互联的全栈式互联底座,旨在为国产AI算力提供一套可演进、可协同、不绑定的系统级基础设施。芯片厂商可基于统一底座灵活构建超节点系统,上层应用可获得横向扩展能力。
IBGDA Demo:国产GPU与国产RDMA网卡直通通信实测
本届WAIC最受关注的技术演示之一,是奇异摩尔与壁仞科技联合展示的IBGDA(GPU直接发起通信)解决方案。在MoE模型的典型训练或推理中,专家并行通信包含Dispatch和Combine两个核心阶段,每个阶段涉及大量小粒度数据交换。传统跨节点通信中,GPU须经由CPU中转指令,产生额外延迟与CPU开销。IBGDA技术通过绕过CPU处理环节,显著降低指令中转等待时间,释放GPU海量线程的吞吐优势。
该测试平台对标英伟达IBGDA测试数据,实测结果达到相应水平。测试表明:IBGDA相较传统IBRC在小包、高频、强同步场景下呈现代际优势——单次小消息带宽显著跃升,原始小包发送及合并发送的吞吐量均实现质的跨越;All-to-All通信延迟大幅缩短,接近翻倍提升;传统方案中小消息时延远大于大消息的“小包惩罚”被彻底消除。
奇异摩尔推出的单通道400G RDMA ASIC引擎基于Kiwi SNIC 800G平台架构设计,已完成软硬件协同开发,兼容专为MoE模型优化的集合通信库(对标DeepEP),并原生支持IBGDA机制。该方案基于开放的以太网生态构建,在继承以太网部署灵活、成本可控优势的同时,为国产算力集群提供了兼具高性能与自主性的Scale-Out网络选择。
布局OSU超节点互联芯粒,锚定下一代光互联
论坛上发布了《共封装光学(CPO)技术白皮书》,由香港科技大学(广州)发起,奇异摩尔携手曦望Sunrise、壁仞科技、图灵量子、奇点光子等单位共同编写。白皮书系统梳理了CPO的技术路径、产业挑战与未来演进方向,明确指出光互联正成为下一代超节点系统的基石。传统电互联受限于铜缆物理极限,光互联的演进路径为:可插拔光模块 → NPO → CPO → OIO(光内生),最终将光互联功能直接集成于计算芯片内部。路径越短,省去DSP可降低延迟、简化系统设计、降低功耗与成本。
奇异摩尔基于网络互连及芯粒技术的长期积累,前瞻布局了OSU(Optical Scale-Up)IO芯粒产品与未来CPO迭代方案的融合路径。在展台上,奇异摩尔与图灵量子展示了共研的下一代基于xPU-CPO的关键技术;与奇点光子展示了直连NPO光互联测试板,搭载奇异摩尔主芯片(内部集成2颗独立芯粒,分别模拟计算芯粒和IO芯粒)及奇点光子定制化NPO进封装引擎。
国产超节点生态共建倡议行动正式启动
在上海市经济和信息化委员会无线电管理处处长杨沛江的见证下,上海市算力网络协会、上海人工智能实验室、中国信息通信研究院华东分院在论坛上正式发起国产超节点生态共建倡议行动。中兴通讯、壁仞科技、沐曦、天数智芯、燧原科技、商汤科技、曙光信息、奇异摩尔等产业链企业共同参与。该倡议旨在汇聚各方优势资源,共同制定开放、兼容的超节点互联标准,打破技术孤岛,推动国产算力网络在系统级协同上迈出实质性一步。
关键要点
- IBGDA实现国产GPU直通国产RDMA网卡:奇异摩尔与壁仞科技联合演示,通过绕过CPU中转,显著降低小包通信延迟,All-to-All通信延迟接近翻倍缩短,小包惩罚被彻底消除,吞吐量显著跃升,实测对标英伟达IBGDA达到同等水平。
- 国产化超节点互联全栈方案覆盖Scale-Out、Scale-Up及光互联:以统一底座解决系统级协同缺失问题,为芯片厂商和上层应用提供可演进、不绑定的基础设施。
- CPO技术白皮书发布,明确光互联演进路径:从可插拔光模块到OIO光内生,奇异摩尔布局OSU IO芯粒,并与图灵量子、奇点光子等伙伴推进NPO/CPO技术落地。
- 国产超节点生态共建倡议启动:联合产业链上下游重量级企业,共同制定开放、兼容的超节点互联标准,
