点击右上角
微信好友
朋友圈

请使用浏览器分享功能进行分享

8月28日,2026中国国际大数据产业博览会期间,中科曙光发布新一代词元加速方案ParaCache。 相关阅读该方案通过保存并复用大模型已经完成的计算结果,减少不同请求、不同计算节点之间的重复计算。测试显示,在约12万词元输入下,ParaCache可使模型开始回答前的等待时间最高降低98.5%;高并发场景下。系统每秒处理的词元量最高达到原来的27倍。
少做重复计算,让算过的直接复用
随着大模型进入长文本、多轮对话、知识库问答和智能体等场景,大量相同或相似内容被反复计算,不仅增加等待时间。 对照阅读也持续消耗算力资源。
ParaCache的思路很直接:把已经算过的结果长时间保存下来,下次需要时直接复用。 同题参见
该方案统一管理GPU显存、CPU内存、固态硬盘和分布式存储,根据使用频率对计算结果进行分层存放和智能调度,并支持在不同请求、不同计算节点之间共享,实现“一次计算、多次使用”。
ParaCache以曙光分布式存储ParaStor为基础,并融合集中式全闪存储FlashNexus,将存储能力从保存原始数据进一步延伸至保存和复用大模型计算结果,在减少重复计算的同时,降低对高成本显存的占用。
“多快好省”,推理效率全面提升
ParaCache带来的价值,可以概括为“多、快、好、省”。同时
“多”:高并发场景下,系统每秒处理的词元量最高达到原来的27倍,同样的硬件资源能够承接更多业务请求。
“快”:输入约12万词元时,单轮对话开始回答前的等待时间可降至0.4秒;连续20轮对话中,这一时间由43.1秒降至4.9秒。
“好”:兼容主流推理框架和国产AI加速卡,可在现有系统基础上接入,降低部署和迁移成本。
“省”:高频内容保留在显存,其他内容转移至成本更低的存储设备,减少对高成本显存和新增硬件资源的依赖。
目前,ParaCache已在国内某头部互联网企业在线推理业务中落地,模型开始回答前的平均等待时间降低50%以上;在同等硬件条件下。系统可承载的业务请求也提升数倍。
同时,ParaCache已在全国产十万卡AI超集群曙光8000上完成验证,可面向长文本对话、知识库问答、智能客服、智能体及高并发推理等场景。
中科曙光分布式存储产品部总经理石静表示,ParaCache不是简单提升单张GPU的性能,而是通过减少重复计算,把更多算力用于处理新的任务。一般来说
过去,存储主要负责保存数据。ParaCache进一步将模型已经完成的计算结果纳入存储和复用体系。对于大模型推理而言,少一次重复计算,就意味着少一段等待,也少一份算力消耗。
围绕本届数博会“词元——数据要素价值释放新路径”主题,ParaCache提供了一条更具体的技术路径:不仅保存数据,也保存数据在计算过程中产生的结果。让一次计算形成的价值被持续复用。

本页围绕「顶胜手机版下载使用方法」整理公开信息,便于对照栏目动态与后续阅读。
移动端与电脑端入口保持一致。如某条暂不可用,可改走栏目列表继续查找。
若从搜索引擎进入,可先确认当前栏目名称,再按需打开相关阅读。
关系多种疾病,科学家首次看清细胞表面“看门酶” | 为推动构建人类命运共同体作出更大上合贡献(和音) | 光明经济 | 成果转化新观察|破壁搭桥,让科技成果真正落地生根 | [青春华章]文物会说话有声海报|穿越千年的“科技力量” | 气候变暖和吉隆县泥石流灾害有关系吗? | 中国疾控中心:建议这8类人群优先接种流感疫苗 | 发展中埃关系,习近平主席强调"不忘初心、继往开来" | 【光明论坛】持续推动高水平科技自立自强取得新突破 | 微观察丨弘扬“上海精神”,上合大家庭“合”力向前
国际 / 时评 / 网站首页 / 顶胜手机版下载使用方法