央视《超级工程》揭秘:曙光8000十万颗芯片这样拧成一股绳

IT时报记者 孙妍

80多组高密度机柜,10万颗智能计算芯片,构成当今世界最强大的算力集群之一。9月25日起,央视纪录片《超级工程——曙光8000》在CCTV-9纪录频道每晚连续播出,首次将这套AI超集群的工程细节完整展现在公众面前。

曾记录港珠澳大桥、中国高铁的《超级工程》,此次对准人工智能界的超级工程——国内首个采用超智融合技术路线的十万卡级AI超集群。第二集《探极境》提出了一个直观的问题:庞大的硬件规模,如何转化为实际的计算能力?

答案并不在某一颗更强的芯片上。在硬件与算力之间,横着三堵看不见的“墙”:通信墙、存储墙、散热墙。拆掉这三堵墙,十万颗芯片才能真正拧成一股绳。

通信墙:等不起的5分钟

在算力集群内部, *** 绝不只是连接设备的通道,更是释放算力、保障算力的关键。曙光8000要织一张中国迄今规模更大的微秒级高速 *** ,连接超过一万个计算节点。接过这张“空白图纸”的,是年仅30多岁的万伟,他成为曙光8000 AI超集群高速互连 *** 总架构师。国内之一次做,他在片中坦言“觉得遥不可及”。而十万卡工程没有试错机会,一步走错,芯片高效协同的蓝图便成一纸空想。

信号在高速 *** 中的传输会发生错误,这是概率性事件:单条链路的出错率小到可以忽略,但曙光8000由几万个部件联网组成,再小的概率乘上庞大基数,都会被放大成“必然”。按规模推算,十万卡集群每小时会出现2.7次传输错误。

错误本身不可怕,可怕的是纠错速度。传统方案如同铁路调度中心:链路一旦故障,先上报控制中心,重算全网路由,再下发指令。测算显示:系统规模到一万卡,查找、纠错时间超过30秒;到十万卡,长达5分钟。“这绝对是不行的。”万伟说。5分钟的通信中断,意味着算力全面停滞,所有计算付诸东流。

在北京最繁华的路口,没有人逐一指挥每个人往哪走,每个人只需做一次简单判断:向左一步,向右一步,快一点,慢一点,无数个微小的选择叠加,拥挤的人流便有序穿过路口。“这就是我们 *** 自主决策想要达到的目标。”万伟意识到,要变革的不是 *** 的调度方式,而是赋予 *** 设备自主应变的能力。

近百人联合攻关随之展开:芯片团队为交换机增加切换能力,这是“自主”的基础;软件团队确保局部路由策略从全局看也是更优;高速信号团队继续压低故障概率。最终方案是在交换芯片中植入“智能开关”,并为每一个地址预设备用路线,一旦检测到路径故障,开关便以毫秒级速度自行切换信号,无须等待调度中心指令。

测试现场,工程师手动拔掉一条 *** 通路,监控程序只轻微抖动了一下,便恢复稳定运行。凭借这套从零起步的 *** ,故障恢复时间不再随规模增长,相关技术已于2026年3月以“scaleFabric”之名发布,走向更多计算场景。

存储墙:为数据修一条专属车道

*** 打通,数据洪流随之而来。曙光8000的存储系统由超十万块硬盘组成庞大阵列,设计目标是每秒完成近亿次读写请求,数据延时要控制在亚毫秒级。否则,再澎湃的算力也难以完全释放。

曙光8000 AI超集群存储研发负责人郭照斌面对的更大挑战依然是规模:数十亿个请求涌进集群后“各自为战”,有的跑得快,有的特别慢,最慢的那条请求,会拉低整个存储系统的响应时间。矛盾焦点是数据通道,“共用一条数据通道,就会产生竞争,就像十几辆货车,堵在我们的门口,谁也进不来。”郭照斌解释道。

在自动化物流仓库里,管理系统为不同方向的机器人规划独立通道,互不干扰。能不能给每一路数据修一条专属车道?团队把新架构命名为“超级隧道”:数据从网卡进来,就近交给离网卡最近的CPU核心,再写入离该核心最近的硬盘,从进门到出门,全程跑在自己的独立通道上,不跨道、不争抢。

一个计算节点与后端存储之间要建立一万个高速通道,十万个计算节点,“十万乘一万,基本就是十亿的量级”。“隧道打通”的测试现场,团队盯了一分多钟屏幕:“终于起来了!”通路性能较此前将近翻倍,存储硬件性能得以完整释放。这项技术此后直接应用于中科曙光的集中式存储FlashNexus系列,分布式存储ParaStor也采用了相关技术理念,让“超级隧道”在千行百业的场景中落地。

散热墙:把金刚石焊进芯片

通信墙与存储墙都打通了,还有最后一堵墙——散热。纪录片给了一个直观的换算:十万颗计算芯片全速运转,持续运行一年半释放的热量,能让西湖里的水瞬间沸腾。曙光8000的刀片服务器,在厚度仅60多毫米的空间里容纳5层主板、20颗计算芯片,单颗芯片满载功耗是办公电脑CPU的5倍以上。

曙光8000的散热底子本不差:浸没式相变液冷,把主板和芯片整个泡进沸点约50℃的冷媒中,芯片一发热,冷媒就在表面沸腾冒泡,热量随之带走,这是业界公认的顶尖散热方案。但芯片功率提升太快,发热量水涨船高。2024年,曙光8000 AI超集群液冷系统设计师常乾坤领衔团队向物理极限攻坚,但从研发到交付周期已不足两年。

解题的钥匙藏在材料里。数十种候选材料被陆续送进实验室,经过一轮轮严苛验证比对,最后留下的是自然界中散热能力最强的材料——金刚石。团队把金刚石粉与铜结合成金刚石铜合金,散热能力达到铜的2倍以上。但满载测试依旧不达标,此时距最终交付只剩6个月。

常乾坤抛出一个大胆的构想:舍弃处理器的金属上盖,砍掉多层导热介质,把金刚石铜散热器直接与芯片裸片焊接,导热路径从传统的4层压到2层。方案逻辑清晰,工艺却是无人区。“焊接时采用什么样的参数标准,谁也给不出来。”常乾坤说,更凶险的是,焊接瞬间散热器与芯片之间极易产生气泡,而气泡正是散热的更大敌人,一旦出现气泡,该区域的散热就会变得非常差。空洞一度让量产按下暂停键。

团队只能自己去闯“无人区”。白天工厂生产完,团队晚上坐卧铺把部件送到焊接厂,工艺迭代十几二十次,硬生生抢回近一个月。X光扫描下,焊接层气泡显著减少。历经50天极限攻关,焊接参数终于被精准锁定。“效果甚至超过了预期。”常乾坤说,这个产品的落地,属于一次“压哨绝杀”。

从单兵作战到体系作战

三堵墙,三种拆墙思路,逻辑却出奇一致:规模大到一定程度,任何单点的“更优”都不再够用,必须靠系统层面的协同重构。 *** 再快,一次中断就能让十万颗芯片集体待机;存储再大,一条慢请求就能拖垮整体;散热再强,一层多余的介质就能压垮极限工况。十万卡集群的算力,不是芯片性能的简单加法,而是由系统里最短的那块板决定的。

这正是央视纪录片第二集《探极境》之问的答案:硬件规模转化为实际计算能力,中间隔着通信、存储、散热等一整套“综合问题”的系统解。算力的竞争,已从芯片的单兵作战,升级为全系统协同突破的体系化较量。

这套体系的价值已在真实任务中检验:依托曙光8000,中国气象局地球系统数值预报中心实现了1小时完成全球未来10天、5公里分辨率的预报计算;中科曙光联合多家科研机构,在全球首次完成具有量子力学精度的“万亿原子”分子动力学模拟,刷新多尺度模拟世界纪录。

“要想富,先修路。”万伟这样形容 *** 之于算力基建的意义,它是“支撑国家向更大算力发展的基石,未来20万卡、百万卡这样规模的一个重要基石”。郭照斌说:“我们也是时代洪流中的一个分子,随着这些挑战一步步去克服,我个人也是乐在其中。”

纪录片的下一幕,是超十亿个精密部件悉数就位后,安装攻坚战的打响。而三堵墙的故事已经证明:让十万个部件像一个人一样协同工作,才是算力基础设施真正的“超级工程”。

出处:林口信息网

网址:http://linkouxx.com/post/173878.html

您的支持是对博主最大的鼓励,感谢您的认真阅读。欢迎转载,但请保留该声明

评论

访客
友情链接

Powered ByZ-Blog. Copyright 2024-2028

您的支持是对博主最大的鼓励,感谢您的认真阅读。欢迎转载,但请保留该声明