元脑服务器推出支持 Mooncake KV 缓存共享的 G3.5 层全闪方案
元脑服务器面向大模型推理场景,推出支持 Mooncake KV 缓存共享的 G3.5 层全闪方案。方案以元脑全闪服务器 NF5286 为核心,与 Mooncake 缓存组件、推理框架的缓存感知调度协同,为推理集群提供独立于计算节点、可按业务需求单独规划的 KV Cache 共享空间。当上下文需求增长时,可以单独扩展缓存资源;当 GPU 节点扩容、调整或维护时,缓存资源也不必完全随计算节点变化。
元脑服务器面向大模型推理场景,推出支持 Mooncake KV 缓存共享的 G3.5 层全闪方案。方案以元脑全闪服务器 NF5286 为核心,与 Mooncake 缓存组件、推理框架的缓存感知调度协同,为推理集群提供独立于计算节点、可按业务需求单独规划的 KV Cache 共享空间。当上下文需求增长时,可以单独扩展缓存资源;当 GPU 节点扩容、调整或维护时,缓存资源也不必完全随计算节点变化。