Reddit r/LocalLLaMA (开源AI)· /u/Theboyscampus·· 3 小时前AI 评分23
vLLM 批量 API 调用共享前缀的最佳实践
Best practice for processing batch vLLM api calls with shared prefix?
AI 导读
一位开发者在 r/LocalLLaMA 上询问 vLLM 共享前缀批量推理的最佳实践。其工作流用 asyncio.gather 同时发起 10 个 vLLM API 调用,共享相同 prompt 前缀、仅结尾查询不同,经具备 KV cache 感知路由的 vllm-router/llm-d 分发到 vLLM worker 池。
来源:Reddit r/LocalLLaMA (开源AI) · reddit.com