异步 RAG 延迟拆解,别让 asyncio 背所有锅

发布时间:2026/8/14 17:22:54
异步 RAG 延迟拆解,别让 asyncio 背所有锅 异步 RAG 延迟拆解别让 asyncio 背所有锅RAG 慢了就加并发通常只能让更多请求一起慢。端到端延迟要拆成查询解析、检索、rerank、上下文组装、模型等待和流式输出先找到真正的等待点。每段都有超时和取消请求取消后检索与模型调用也应停止。使用同一请求标识串起日志和 trace分别记录排队与执行时间。超时预算从入口向下分配不能让某个下游单独等得比整条请求还久。并发不是越大越好数据库连接池、模型限额和 CPU rerank 各有容量。为每类资源使用独立信号量或有界队列避免一个慢依赖占满全部槽位。重试只处理明确可恢复且幂等的失败。优化后检查答案没有变坏固定查询与语料版本除了延迟也比较召回文档、引用和失败分类。缓存命中时注明键和失效规则不能拿缓存结果与冷请求混在一起下结论。异步只是组织等待的工具。链路拆得清、取消传得到性能问题才不会被一层层协程藏起来。

相关新闻