跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 21–25 条 · 共 25 条
3月17日周二
  1. Mistral AI68

    Mistral 发布 Mistral Small 4,统一推理、多模态与智能体编码能力

    Mistral 发布开源模型 Mistral Small 4,将 Magistral 推理、Pixtral 多模态和 Devstral 智能体编码能力统一到一个模型中,采用 Apache 2.0 许可证。

    推荐理由:原文给出了完整的架构参数、效率对比和部署配置,读者可以据此评估一个开源混合推理模型是否值得替换现有专用模型组合。

1月22日周四
  1. Mistral AI64

    Mistral AI 详解 vLLM 内存泄漏排查:从 Heaptrack 到 BPFtrace 和 GDB 定位 UCX mmap 钩子

    Mistral AI 团队排查 vLLM 在 P/D 分离部署(经 NIXL/UCX)下 Mistral Medium 3.1 的内存泄漏,生产级流量下系统内存以每分钟 400 MB 线性增长,数小时后触发 OOM。

    推荐理由:原文完整记录从 Heaptrack、pmap、BPFtrace 到 GDB 的逐层排查路径,读者可迁移用于追踪堆外内存泄漏。

12月3日周三
  1. Mistral AI76

    Mistral 发布 Mistral 3 系列:Mistral Large 3 与 Ministral 3 全线以 Apache 2.0 开源

    Mistral 发布 Mistral 3 系列模型,包含 Mistral Large 3(675B 总参数、41B 激活的 MoE)和 Ministral 3 系列(3B、8B、14B),全部以 Apache 2.0 许可开源,并发布 base、instruct 及 reasoning 变体。

    推荐理由:原文给出了各型号参数、开源许可和部署路径,读者可以据此判断哪个尺寸适合自己的场景。

9月9日周二
5月7日周三
  1. Mistral AI65

    Mistral AI 发布 Mistral Medium 3:以约 1/8 成本达到 Claude Sonnet 3.7 九成性能

    Mistral AI 发布 Mistral Medium 3,定位 SOTA 性能、成本降低 8 倍的新一级模型,在多项基准上达到 Claude Sonnet 3.7 的 90% 以上,价格 $0.4 input / $2 output per M token。

    推荐理由:官方给出基准对比、价格与最低 4 GPU 部署要求,读者可据此评估它在成本和企业落地上与竞品的差距。