根据报道,华为正式发布了 AI 推理创新技术 UCM(推理记忆数据管理器)。
华为推出的 UCM(推理记忆数据管理器)是一款以 KV Cache 为中心的推理加速套件,融合多类型缓存加速算法工具,通过分级管理推理过程中产生的 KV Cache 记忆数据,扩大推理上下文窗口,实现高吞吐、低时延的推理体验,,降低每 Token 推理成本。
此外,华为计划于 2025 年 9 月正式开源 UCM,届时将在魔擎社区首发,后续逐步贡献给业界主流推理引擎社区,并共享给业内所有 Share Everything (共享架构) 存储厂商和生态伙伴。