跳到正文

全部动态

今日 161 条
今天9月30日周三
  1. Reddit r/MachineLearning32

    多智能体 LLM 循环一夜险烧 $1,200:如何设置硬性费用上限

    一位开发者部署基于 Anthropic/OpenAI API 的轻量级多智能体系统时,复杂提示词触发无限递归循环,一夜几乎烧掉 $1,200。原生 API 仪表盘仅在越过阈值后或延迟数小时才告警,凌晨的邮件提醒无法止损。作者建议在请求到达提供商前设置硬性代理费用上限,直接切断连接。

  2. Reddit r/LocalLLaMA (开源AI)23

    vLLM 批量 API 调用共享前缀的最佳实践

    一位开发者在 r/LocalLLaMA 上询问 vLLM 共享前缀批量推理的最佳实践。其工作流用 asyncio.gather 同时发起 10 个 vLLM API 调用,共享相同 prompt 前缀、仅结尾查询不同,经具备 KV cache 感知路由的 vllm-router/llm-d 分发到 vLLM worker 池。

  3. Reddit r/LocalLLaMA (开源AI)12

    Pi 配合 llama-server 偶发随机卡死问题求助

    一位用户在 Reddit r/LocalLLaMA 反馈,用 Pi 搭配 llama-server 时偶发卡死:工具调用后 llama-server 日志显示已完成,Pi 却仍在等待响应,需手动让其"Continue"。该问题仅在约 1% 的情况下出现,用户运行的是 Unsloth 的 Qwen3.6 35B A3B IQ4_NL_XL,并称其他模型也曾发生,正向社区求助。