第2494章 既然已经走在前面了,就不能再落后(2 / 2)
而背地里的驱动力是,大屿山B实验室对“悟空”的应用,让专业人士们看到了更多的,让人惊讶过后,满是憧憬和期待应用方向。
决策确定后,为了少走弯路,吸取之前的一些教训,决定让计算机中心来领衔这项任务。
邓副局长这趟来可园,属于打前站,探一探口风。
没办法,任性就算了,脾气还臭,嘴比脾气更臭……
“曲主任……”邓副局长稍稍酝酿了一下,开口:“你说咱们的这个MIMD架构超级计算机,能不能作为类似于悟空那样的,人工智能体的运行载体?”
“跑人工智能呀……”曲卓稍稍琢磨了一下:“有优势,也有劣势。”
“能具体说说吗?”邓副局长打起精神,集中注意力倾听接下来的话。
“MIMD架构从设计层面,就天然适配人工智能体。”曲卓见邓副局长神色认真,细致的解释:“多处理器支持多条独立推理分支并发推演。
部分节点负责知识库检索、部分负责逻辑推导、部分负责自然语言解析。子任务随时产生、随时销毁。每个处理器独立运行不同程序、独立分支、独立指令流。
银河有1024个处理器,比奥丁多一倍,理论推理和自训练效率,高的不止一倍。”
邓副局长努力记住,追问:“劣势呢?”
“劣势主要有四个方面。”曲卓放缓语气:“首先,就是我刚说的通信链路带宽瓶颈。
虽然1024颗处理器组成10维超立方体,最远节点之间仅需要10次数据转发,网络平均延迟是可控的。但,只是小规模并行推理尚可。
一旦智能体需要全局知识库检索、跨大量节点交换上下文信息,大量小包并发就会挤占通道,出现网络拥塞。”
“稍等。”邓副局长感觉单凭脑子根本记不住,从包里掏出工作笔记和钢笔。
翻到一个空白页,先捡要点把之前听到的技术局限和适配人工智能体的优势记下来,又另起一页。
稍稍回忆了下刚听到的内容,记录下通信链路带宽瓶颈和后面的解释。
凭记忆写完后,抬头看曲卓。
“第二。”曲卓继续:“单芯片本地内存只有2Kb,做科学计算够用,但对人工智能体要加载的庞大数据来说,太小了。
如果加外置内存,每一次读取大容量知识库,都需要通过串行链路向外存取,会加重我刚才说的通讯链路带宽压力,进一步推高延迟。”
稍稍给了邓副局长一些记录的时间,曲卓继续说:“第三,也是我之前提到的,时钟异步的问题。
大规模集群中,不存在全局统一时钟。当多节点需要同步协作推演时,必须额外增加同步握手协议,这会占用,并持续消耗带宽。
第四,动态负载均衡很难。AI智能体推理任务的负载极不稳定,有的分支快速收敛,有的分支持续深度推演。
超立方体构架缺少全局调度单元,容易出现一部分芯片满载、一部分闲置,导致算力利用率波动巨大。
简单的说,就是……空有很高的算力。但在实际使用中,资源无法被高效利用。一千多颗处理器忙的忙死,闲的闲死。
而这种负载不均衡的情况,又会加重温度变化和电压波动。时钟抖动的情况进一步加剧,协作推演时效率更低,带宽消耗更大,还加重网络堵塞。”
邓副局长边记录边消化,虽然对具体原理依旧不甚明了,但通过文字的纸面含义能看出来,四个点劣势不是孤立存在的,而是相互关联相互叠加……