日均Token调用140万亿,算力底座还撑得住吗?
今儿参加了词元经济生态大会,现场见证多个重磅项目签约、落地。
2024年初国内日均Token调用量刚过1000亿,到今年3月直接飙到140万亿,翻了1400倍。上个月的数据更吓人,逼近175万亿了。模型参数从千亿到万亿,上下文从4K到128K再到百万Token,算力压力是指数级往上走的。
中场休息时我跟一起去的朋友聊,他说Token量上去了,模型跑得欢,但底层要是扛不住,全白搭。现在推理并发量跟两年前完全不是一个量级,光靠堆卡已经解决不了问题了。
海光亮出的CPU+DCU双芯协同架构,覆盖大模型训练、在线推理等不同计算需求,DCU适配了超400款主流大模型。海光的杜总在演讲里提了一句挺实在的话,词元经济走向规模化,底层算力不能只满足于供得上,还得解决适配、效率和稳定服务的问题。
Token时代拼的不是谁家纸面算力高,而是谁家能让算力高效地转化成Token、稳定地输出。海光信息 Token
