让大模型少做重复计算 中科曙光发布ParaCache

让大模型少做重复计算 中科曙光发布ParaCache

让大模型少做重复计算 中科曙光发布ParaCache-第1张图片

  中科曙光8月28日发布新一代词元加速方案ParaCache。据了解,该方案通过保存并复用大模型已经完成的计算结果 ,减少不同请求 、不同计算节点之间的重复计算 。

  随着大模型进入长文本、多轮对话、知识库问答和智能体等场景,大量相同或相似内容被反复计算,不仅增加等待时间 ,也持续消耗算力资源。中科曙光分布式存储产品部总经理石静在接受采访时表示,通过“以存换算 ”节约算力已经是业界共识。

  据介绍,ParaCache通过统一管理GPU显存 、CPU内存、固态硬盘和分布式存储 ,根据使用频率对计算结果进行分层存放和智能调度 ,并支持在不同请求、不同计算节点之间共享,实现“一次计算 、多次使用” 。测试显示,在约12万词元输入下 ,ParaCache可使模型开始回答前的等待时间比较高 降低98.5%;高并发场景下,系统每秒处理的词元量比较高 达到原来的27倍。

  石静表示,存储已经从被动的IO响应 ,转向深度的数据调度 、缓存复用、计算卸载,这是AI驱动基础设施的一次结构性变化。

  近来 ,ParaCache已在国内某头部互联网企业在线推理业务中落地 ,并已在全国产十万卡AI超集群曙光8000上完成验证,可面向长文本对话、知识库问答 、智能 *** 、智能体及高并发推理等场景 。

(文章来源:上海证券报·中国证券网)

©版权声明
THE END