RAGO

Systematic Performance Optimization for Retrieval-Augmented Generation Serving
深度分析报告 谷歌 DeepMind × UCSD ACM SIGCOMM 2025 首篇 RAG 服务端全链路优化

📋 论文基本信息

正式标题RAGO: Systematic Performance Optimization for Retrieval-Augmented Generation Serving
作者机构谷歌 DeepMind, 加州大学圣地亚哥分校 (UCSD)
核心定位业界首篇针对 RAG 服务端的全链路系统化异构资源优化研究
开源支撑提供完整的 Artifact 开源项目,可直接复现实验效果

🎯 RAG 技术的产业价值

RAG 是解决纯大模型(LLM-only)三大固有缺陷的 industry standard 技术路径:

  • 知识时效性 — 低成本增量更新
  • 事实幻觉风险 — 外部数据源可溯源
  • 部署成本 — 小模型+检索

⚠️ 现有技术的研究缺口

当前优化聚焦于检索算法本身,采用与传统 LLM 服务端完全一致的纯拆分部署架构,无法覆盖 RAG 流水线的复杂度。

1. 多组件异构性缺口 — 缺乏对向量检索、查询重写、重排、推理等多类型异构负载的统一调度机制。
2. 工作负载可变性缺口 — 缺乏标准化的工作负载抽象,无法对不同 RAG 配置的性能做横向对比与系统化优化。
3. 流水线阻塞性缺口 — 迭代检索导致推理流水线频繁切换,现有策略未考虑跨阶段依赖关系,易出现资源空闲。

🧩 核心设计原则

抽象
工作负载标准化
量化
开销与瓶颈建模
自动化
系统化优化框架

📐 RAGSchema: 标准化负载抽象

业界首个面向服务端性能优化的 RAG 工作负载结构化抽象,解决了性能不可比、优化无基准的难题。

属性维度内容
检索侧属性向量库规模、topK、文档长度...
流水线侧属性查询重写、重排、迭代检索频率...
资源侧属性CPU/GPU 规模、存储类型、网络延迟...

四类典型 RAG 范式

  1. 超大规模检索 (Hyperscale Retrieval)
  2. 长上下文排序 (Long-Context Sequence Processing)
  3. 解码中迭代检索 (Iterative Retrievals + Prefix)
  4. 带查询重写+重排序的完整流水线

🔍 四类场景瓶颈分析

场景一:超大规模检索
亿级至千亿级向量库,高并发,topK>100
• 检索阶段开销占比 >60%
• 瓶颈在 CPU 侧(计算、IOPS、内存带宽)
• 批处理规模失衡导致资源空闲
核心结论:检索效率直接决定系统吞吐量上限
场景二:长上下文排序
单文档 >1000 token,总长度 >4096 token
• 前缀阶段开销占比 >50%
• 1:1 资源分配比例完全不匹配
• KV-cache 传输放大内存带宽瓶颈
核心结论:前缀阶段 GPU 资源配比对性能影响最大
场景三:解码中迭代检索
解码阶段触发多轮检索,单轮对话检索 >2 次
• 流水线阻塞空闲是核心瓶颈
• 批处理比例失衡导致延迟高 2.77 倍
• 网络传输延迟被多轮迭代放大
核心结论:批处理比例失衡比检索延迟更严重
场景四:完整流水线
含 8B 查询重写模型、120M 重排模型
• 查询重写是 TTFT 延迟核心来源 (+140%)
• 重排模块影响可忽略 (<5%)
• 小模型部署位置放大网络依赖
核心结论:小模型的部署策略对端到端延迟影响巨大

⚙️ RAGO 系统化优化框架

业界首个覆盖 RAG 全链路的异构资源优化调度框架,核心是 "混合协同-拆分调度策略"。

策略内容
任务放置强拆分(主 LLM 前缀/解码)· 协同部署(计算密集型)· 弱拆分(强依赖阶段)
资源分配计算密集型→高算力 GPU/TPU · 内存密集型→高带宽内存 · 检索→多核 CPU
批处理策略延迟敏感→小批量(TTFT 优先)· 吞吐敏感→大批量 · 检索→动态调整与解码对齐

📊 核心实验结果

2x
单芯片 QPS 提升
-55%
TTFT 延迟降低
-60%
硬件成本降低
-70%
流水线等待消除

在四类场景下均保持稳定正向优化,且没有牺牲任何检索精度或生成质量。

🚀 行业落地价值

  • 支撑成本与体验平衡
  • 提供部署最佳实践
  • 现有流水线无侵入集成
  • 适配 Agent 场景优化
  • 验证"小模型+检索"范式

⚠️ 技术局限性

局限说明
场景覆盖限制未覆盖复杂 Agentic RAG 场景(多工具编排、长时自治任务)
部署环境限制仅考虑单集群内调度,未覆盖多集群、跨可用区部署
优化维度限制未覆盖向量检索算法本身及存储层硬件级优化
调度目标限制未将能耗、硬件成本、SLA 优先级纳入成本模型

🔭 后续研究方向

  1. 场景扩展 — 覆盖更复杂的 Agentic AI 流水线负载特征
  2. 算法-系统协同优化 — 整合向量检索算法级优化与系统级调度
  3. 调度目标多元化 — 纳入能耗、成本、SLA 优先级、网络波动
  4. 硬件架构定制 — 针对存算一体、近数据计算等新硬件定制策略

💡 核心结论

方法论价值:建立了一套从工作负载抽象、到瓶颈建模、再到异构资源协同调度的完整系统化优化方法论,填补了 RAG 技术在算法层与系统层之间的优化缺口。

关键技术结论:

  • RAG 系统需采用 混合协同-拆分的调度策略,不能照搬 LLM-only 方案
  • 不同场景核心瓶颈差异极大,需通过 标准化负载抽象精准定位
  • 批处理比例对齐是优化迭代检索场景性能的关键
  • 系统化调度优化可使"小模型+RAG"性能 超越超大参数纯 LLM 方案

本页面由 AI 辅助整理,基于用户提供的 RAGO 论文分析材料。

⚠️ 免责声明

本站内容均由 AI 基于公开知识辅助生成,仅供学习参考,请勿直接引用作为依据。作者不对信息的准确性、完整性及适用性作保证,亦不对因使用本站内容产生的任何损失承担责任。