智能时代,生产力范式要想真正实现跃升,只有将算力、Token(词元)的边际成本降低至临界点,Agent(智能体)才能充分释放出规模化应用的价值。
过去,算力产业界往往聚焦于模型参数、单卡峰值算力和训练集群规模,属于“堆芯片、拼参数”的粗放型阶段;现在,随着Token 经济与多智能体规模化落地的交汇,推理调用爆炸性增长、成本敏感度迅速提升,单纯追求“跑分峰值”的方式已然行不通,“服务应用、创造价值”将成为关键新阶段。
因此,算力产业迎来一个历史性的转折点,评价体系、竞争维度和产业逻辑也随之发生深刻变革,“用得好”将成为黄金准则。
近日,在2026中国国际大数据产业博览会上,海光信息正式发布“Agent to Token”开放计算架构,围绕从Token生产到Agent应用,构建起“数据接入→任务编排→Token生产→价值输出”的全链条架构能力,为千行百业的智能化转型带来提效、托底和赋能的一体化算力方案。
每一个Token都要更高效
在智能世界中,Agent是当之无愧的价值核心,而Token则是不容忽视的成本核心。
IDC最新预测表明,中国企业活跃Agent数量将在 2031 年突破 3.5 亿规模,年复合增长率达到 135% 以上;在企业的智能化转型中,多智能体规模化落地已是大势所趋。
在Agent工作机制中,它需要感知环境、分解任务、调用工具、分析决策和执行操作,加上复杂场景的多智能体协同,让任务执行密度和复杂度大幅提升,这种趋势带来最直接结果就是Token调用和消耗量的指数级增长。
信通院最新数据显示,2026年6月份,我国日均Token调用量激增至近175万亿,较2024年初增长1750倍;Token调用量的爆发,也让Token产出和推理效率成为产业发展的关键变量。
本质上,这是算力需求的一次结构性变革。
首先,算力评价体系走向精细化。IDC预测,到2027年,推理将占智能算力需求的70%以上,“每瓦Token数”正在成为新的行业KPI,"单位电力、单位成本下产出更多、更有价值的Token”将会成为算力产业追求的核心目标。
其次,算力竞争维度走向全链路化。从过去单一芯片性能、集群规模的简单比拼,全面转向“数据接入→任务编排→Token生产→价值输出”的全链路能力竞争。
第三,算力产业逻辑走向服务化。过去的算力产业以建设为核心,现在每一枚Token都需要追求精准产出、高效调用和快速交付,Token成为连接电力、算力、模型、应用与商业价值的度量衡,而这也将驱动算力基础设施全面走向服务化,“用得好”将成为追求的核心目标。
因此,面向AI应用落地的迫切需求和算力产业范式的加速变革,海光信息率先出手,面向AI全周期管理流程打造出“Agent to Token”开放计算架构,助力企业AI应用的规模化落地和Token高质量应用。
“Agent to Token”开放计算架构:双芯协同的可靠底色
众所周知,在AI大模型高速发展的期间,AI算力属于典型的建设型资源,以“ GPU 为核心、CPU仅为辅助”的思维深入人心;但进入到智能体时代,异构算力协同成为关键演进方向。算力产业界认为,智能体负载在 CPU 端处理延迟可达 90%+,企业的算力体系中 CPU:GPU的比例未来将收敛至1:1。
事实上,海光信息的Agent to Token开放计算架构正是异构算力协同的典范。作为面向AI全周期管理的流程化算力架构,Agent to Token开放计算架构依托海光信息CPU+DCU双芯与HSL开放互连协议,贯通从Agent应用到词元生产的全栈体系,可打造出算力提效、安全托底、生态赋能为核心打造一体化算力方案。
与传统算力“芯片→服务器→集群→算力输出”的供给逻辑不同,Agent to Token开放计算架构的逻辑是从“业务需求”出发,经过“智能体调度”来组织算力,最终产出“词元”和“交付结果”,算力资源不再是终点,而是让智能体规模化应用的手段。
具体来看,在海光信息Agent to Token开放计算架构中,CPU是智能体工作流的系统枢纽,被赋予系统指挥官的角色,针对智能体业务流拆解为机头、沙箱、编排、记忆体存储和数据库五个压力模块,并承担起智能体指令流的任务编排、实时决策、高频工具调用、向量数据库与记忆检索、沙箱隔离和权限边界等工作。
例如,多智能体协同必然会带来到一系列的安全需求。为此,海光信息C86 CPU通过多核多线程、硬件虚拟化和NUMA与安全隔离等技术确保智能体安全运行。
如果说 CPU 解决了智能体各种任务的“思考与调度”,那么海光 DCU 则是面向 Token 生成的并行计算引擎,专注于大模型推理中 Token 生产的“极速并行解算”。
围绕推理场景的算力瓶颈、显存容量限制、通信开销、高并发、长上下文和成本能耗等工程问题,DCU承载词元生成流的并行计算与加速优化,包括并行批量解码、KV缓存加速、预处理加速、序列支撑以及相关推理优化。
例如,在连续词元生成阶段,逐词元解码是占 P99 长尾时延 83% 的主战场。海光信息DCU 通过定制优化 GEMV 核心算子,推行算子融合与显存分配器优化,减少解码阶段的冗余内存访问。又如,超长上下文推理已经成为一项刚性需求,海光信息DCU深度适配稀疏注意力机制,成功支撑多款业界前沿大模型的长上下文高效推理。
支撑Agent to Token异构算力底座的关键则是海光自主研发并开放的高性能可扩展系统HSL(hygon system link)开放互连协议,HSL恰似为枢纽与引擎构建起一条智能化的高速公路,让多个计算单元紧密协同与高效配合,为智能体工作流提供高速低延迟的互连服务。
此外,Agent to Token开放计算架构自带内生安全,从Agent业务流开始,延伸至词元生产,为密钥、链路、平台、智能体隔离、模型权重存储及系统启动等环节提供保护。
开放:让“用得好”照进现实
长期以来,异构多元计算均面临着技术割裂、生态封闭等产业痛点,不仅妨碍了算力领域的创新,更为算力规模化应用带来困扰。
为此,海光信息Agent to Token开放计算架构从伊始就自带开放的底色,实现算力、互连、安全和软件栈的四维开放。
以令不少企业头疼的异构多元算力协同为例,Agent to Token开放计算架构依托HSL互连协议,一套协议让不同芯片互连与协同不再成为难事,可以组建海光 CPU + 海光 DCU(原生)、其他厂商 CPU + 海光 DCU、海光 CPU + 其他厂商 GPU、海光嵌入式(端侧)+ 云端 DCU(云边协同)等可扩展、可替换、可演进的异构算力方案。
同样,除了硬件开放之外,软件栈的开放也对于智能体规模化应用至关重要。在Agent to Token开放计算架构中,通过DTK、DAS、DAP等软件能力,面向主流AI框架、编译器、运行时、算子库、推理引擎和容器编排系统提供开放适配,降低模型迁移、应用开发和异构部署成本。
例如,DAS集成 2000+ 算子,支持 100+ 框架,并对GLM/DeepSeek/Kimi/Qwen等主流前沿模型进行深度优化;UPTK则提供统一异构编程工具包,实现"一套代码、多端部署",并且CUDA 用例移植效率提升 50%+,且配套团标与国标。
无疑,通过四个维度的彻底放开,海光信息Agent to Token开放计算架构能够有效打破封闭软硬件生态的壁垒。此举意义重大,不仅能够光合组织上下游广大成员更加紧密协作,又能够高效推动算力与AI应用的创新速度,加速智能体的规模化落地;更能够帮助企业打破软硬件生态的壁垒,实现基于自身业务场景自由选择最佳的算力组合和技术生态的无缝演进,让“用得好”照进现实。
写在最后
当智能体时代开启,宣告单纯依靠堆砌硬件参数时代彻底终结,转而考验芯片、算力网络、基础软件、开发工具链与应用生态之间的整体协同效率。因此,一个能实现最低边际成本、最高安全信任以及最开放生态体系的算力新范式将成为企业未来AI转型的刚需。
海光信息Agent to Token开放计算架构的出现,无疑是对算力产业迈入新阶段的一次强有力回应。它不试图用一套封闭的标准去“统一”世界,而是用开放的策略去“连接”不同的芯片、不同的模型、不同的开发者、不同的行业。面向未来,智能体的规模化落地不是重点,而是Token经济大时代的序幕,而Agent to Token开放计算架构必然也将在算力服务中迎来更大舞台。
红包分享
钱包管理

