导读:面对金融大模型长上下文推理存在加载慢、重复计算等性能瓶颈,招行率先完成IndexCache 特性在 SGLang、vLLM-Ascend 国产 NPU 路径的适配与开源贡献,通过跨层索引复用削减冗余计算,最高实现推理提速 1.73 倍,多场景加速效果稳定且无损精度,助力金融 AI 算力优化与开源生态共建。
长上下文成大模型推理新瓶颈
随着金融行业全面拥抱大模型,智能研发、研报解读和企业知识库问答等场景对长文本理解能力提出了更高要求。长上下文推理性能,正成为金融AI应用的核心瓶颈。几十K甚至上百K的长文本输入,“加载慢、响应迟”成为用户最直观的痛点。
以DeepSeek、GLM系列为代表的新一代大模型,采用DSA、CSA等为代表的稀疏注意力来降低长上下文推理成本:先用轻量索引器(Indexer)对所有token打分、选出top-k,再让主注意力层只在这k个token上计算。然而,稀疏注意力虽然降低了主注意力计算量,但索引器仍需逐层重复打分,并且计算开销随网络深度线性增长,成为新的性能瓶颈。
首个向开源社区贡献NPU IndexCache特性
针对上述问题,我们率先将清华大学实验室提出的IndexCache方案(IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse)引入,首次在SGLang 和 vLLM-Ascend框架上完成NPU路径的适配,整体推理加速最高可达1.73倍,得到社区的高度认可,相关工作已完整贡献到开源社区并被合入,体现了我们在国产算力长上下文推理优化上的前瞻判断与快速落地能力。
Sglang适配 IndexCache
- # 21502 [Feature] IndexCache support for DSA model
- 贡献点:为SGLang的稀疏注意力模型补齐IndexCache在国产NPU路径上的工程实现,允许跨层复用top-k index,减少重复indexer计算。
- 直接效果:以DeepSeek W8A8模型为例,100K长上下文输入下端到端时延降低 42.44%、总吞吐提升73.91%;在20K~100K上下文与1~10并发的多组场景下加速稳定,上下文越长加速越显著,且精度无损。
- 版本发布:该PR已合入SGLang主干,并随SGLang v0.5.10正式发布。
vLLM-Ascend适配 IndexCache
- # 8398 [Feature] IndexCache support for DSA model
- 贡献点:为vLLM-Ascend的稀疏注意力模型补齐IndexCache在国产NPU路径上的工程实现,允许跨层复用top-k index,减少重复indexer计算。
- 直接效果:以GLM-5.0 W8A8模型测试为例,20K长上下文输入场景下端到端时延降低约 14.19%、总吞吐提升约 16.55%;在不同并发的多组场景下加速稳定,上下文越长加速越显著,且精度无损。
- 版本发布:该PR已合入vLLM-Ascend主干,跟随后续版本发布。
IndexCache加速方案解读
DSA稀疏注意力架构示意图

IndexCache加速原理
IndexCache的核心思路是将DSA为代表的稀疏注意力中“逐层独立重算Indexer”的固定模式,改造为“少量Full层重算 + 多数Shared层复用”的可配置模式。

IndexCache跨层索引复用DSA稀疏注意力模式示意图
在该架构下:
- Full层(F层):执行完整的Indexer评分流程,生成新的top-k 索引;
- Shared层(S层):跳过Indexer评分,直接复用最近一个Full层的索引;
- 可配置:可由 index_topk_freq 灵活设置Full层比例(如1/2、1/4)。
通过这种“少算多复用”的方式,Indexer的计算开销从“随网络深度线性增长”变为“按配置比例可控”,从源头消除重复计算瓶颈。
招行此次将IndexCache工程化落地到SGLang与vLLM-Ascend,既完成了从理论到工程的关键跨越,又为开源协同创新提供了实践范例。这是招行架构管理团队和零售信用卡开发团队深耕开源生态的又一成果。凭借在SGLang、vLLM等社区的长期积累,团队将持续推动更多前沿技术落地,加速金融行业智能化转型。
导读:面对金融大模型长上下文推理存在加载慢、重复计算等性能瓶颈,招行率先完成IndexCache 特性在 SGLang、vLLM-Ascend 国产 NPU 路径的适配与开源贡献,通过跨层索引复用削减冗余计算,最高实现推理提速 1.73 倍,多场景加速效果稳定且无损精度,助力金融 AI 算力优化与开源生态共建。
长上下文成大模型推理新瓶颈
随着金融行业全面拥抱大模型,智能研发、研报解读和企业知识库问答等场景对长文本理解能力提出了更高要求。长上下文推理性能,正成为金融AI应用的核心瓶颈。几十K甚至上百K的长文本输入,“加载慢、响应迟”成为用户最直观的痛点。
以DeepSeek、GLM系列为代表的新一代大模型,采用DSA、CSA等为代表的稀疏注意力来降低长上下文推理成本:先用轻量索引器(Indexer)对所有token打分、选出top-k,再让主注意力层只在这k个token上计算。然而,稀疏注意力虽然降低了主注意力计算量,但索引器仍需逐层重复打分,并且计算开销随网络深度线性增长,成为新的性能瓶颈。
首个向开源社区贡献NPU IndexCache特性
针对上述问题,我们率先将清华大学实验室提出的IndexCache方案(IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse)引入,首次在SGLang 和 vLLM-Ascend框架上完成NPU路径的适配,整体推理加速最高可达1.73倍,得到社区的高度认可,相关工作已完整贡献到开源社区并被合入,体现了我们在国产算力长上下文推理优化上的前瞻判断与快速落地能力。
Sglang适配 IndexCache
vLLM-Ascend适配 IndexCache
IndexCache加速方案解读
DSA稀疏注意力架构示意图
IndexCache加速原理
IndexCache的核心思路是将DSA为代表的稀疏注意力中“逐层独立重算Indexer”的固定模式,改造为“少量Full层重算 + 多数Shared层复用”的可配置模式。
IndexCache跨层索引复用DSA稀疏注意力模式示意图
在该架构下:
通过这种“少算多复用”的方式,Indexer的计算开销从“随网络深度线性增长”变为“按配置比例可控”,从源头消除重复计算瓶颈。
招行此次将IndexCache工程化落地到SGLang与vLLM-Ascend,既完成了从理论到工程的关键跨越,又为开源协同创新提供了实践范例。这是招行架构管理团队和零售信用卡开发团队深耕开源生态的又一成果。凭借在SGLang、vLLM等社区的长期积累,团队将持续推动更多前沿技术落地,加速金融行业智能化转型。