跳到正文
原文
Reddit r/LocalLLaMA (开源AI)· /u/Theboyscampus·· 3 小时前AI 评分23

vLLM 批量 API 调用共享前缀的最佳实践

Best practice for processing batch vLLM api calls with shared prefix?

AI 导读

一位开发者在 r/LocalLLaMA 上询问 vLLM 共享前缀批量推理的最佳实践。其工作流用 asyncio.gather 同时发起 10 个 vLLM API 调用,共享相同 prompt 前缀、仅结尾查询不同,经具备 KV cache 感知路由的 vllm-router/llm-d 分发到 vLLM worker 池。

来源:Reddit r/LocalLLaMA (开源AI) · reddit.com