让 AI 成为资产而非开支:企业如何经济地运营 AI
当 AI 从实验走向生产,仅按 consumption 模式按次购买 token 会让支出难以预测。文章提出企业应寻找"交叉点":当需求稳定、可预测且规模够大时,自建并优化算力可能比逐次购买更经济,但收益取决于把产能持续用满。HPE 赞助内容建议企业按工作负载建模成本、用运营纪律提升利用率,让 AI 从开支变为资产。
当 AI 从实验走向生产,仅按 consumption 模式按次购买 token 会让支出难以预测。文章提出企业应寻找"交叉点":当需求稳定、可预测且规模够大时,自建并优化算力可能比逐次购买更经济,但收益取决于把产能持续用满。HPE 赞助内容建议企业按工作负载建模成本、用运营纪律提升利用率,让 AI 从开支变为资产。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,主打聚焦编码和知识工作,多数任务成本更低、速度更快。
推荐理由:原文说明了 Sonnet 5.5 的能力变化、与 Opus 5.5 的分工方式,以及在 Amazon Bedrock 上的具体接入步骤。
AWS 在 SageMaker AI 上通过 vLLM-Omni Deep Learning Container 部署 Qwen3-TTS,实现文本流入、音频流出的双向流式语音输出,语音可在生成完成前开始播放。
在 Amazon SageMaker AI 上部署同一个 AWS vLLM-Omni DLC 的两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 根据图像和 motion prompt 生成视频。
AWS 展示了基于 Amazon Nova Act 与 Amazon Bedrock AgentCore 的智能体驱动合成监控方案,用自然语言动作替代传统 Selenium/Playwright 的 DOM 选择器脚本,降低 UI 变化导致的脚本脆弱性。
AWS 提供一套 Amazon Textract adapter 生命周期管理方案,覆盖 Custom Queries adapter 跨账户晋升、生产安全配置和文档路由。
AWS 提出在 Amazon EKS 上结合 EFA 与 DeepEP 的架构,加速 MoE 模型的大规模强化学习训练,吞吐量提升 40%。该方案针对 RLHF 与 GRPO 等流程中 rollout 生成与策略训练资源竞争、跨节点通信带宽受限等问题,由 DeepEP 优化 Expert Parallelism 的 all-to-all token 路由通信。
GitHub 工程团队重构了 GitHub Copilot 应用的 PR 视图,使其能流畅打开一个含 2,200 个文件、超过一百万行变更和 400 多条内联评论的开源 PR。
Microsoft Research 系统研究物理 AI 机器人工作负载,发现仅靠机载 GPU 会限制性能、电池续航与可扩展性,将推理卸载到边缘或云端 GPU 可提升任务成功率。
Physical AI 正从研究走向大规模部署,ABI Research 预计到 2035 年 L3-L5 级自动驾驶汽车保有量将达 4900 万辆,Omdia 估计 2026 至 2035 年间将部署约 6000 万台工业机器人。
NVIDIA 在大埃及博物馆举办活动,展示埃及 AI 生态从能力建设走向生产级落地。埃及的 NVIDIA Deep Learning Institute 学员一年内增长超十倍;6 月埃及国家电信监管局批准 Hassan Allam 数据中心牌照,与 A15 合作建设约 4 亿美元投资的数据中心。
GitHub 团队用 AI 智能体把 Copilot 智能体运行时从 TypeScript/Node.js 原地重写为 832,378 行生产 Rust,128 个 pull request 在约十四周半内增量合入并随主分支发布,8 月 21 日完成 100% Rust。
推荐理由:作者亲述用 AI 智能体把 Copilot 运行时原地迁移到 Rust 的完整过程,迁移策略、会话数据和踩坑经验都可迁移到类似工程。
GitHub 日本与韩国营销负责人 Tomoko Tanaka 介绍如何不写代码,把活动运营交给 GitHub Copilot 执行:用 issue form 收集输入,event-setup 标签触发 GitHub Actions 自动建落地页、生成 UTM 链接、起草邀请邮件和更新项目板。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演进式内核搜索框架,构建 MLX 后端和 CUDA-to-MLX 结构化翻译层,把现有 CUDA 内核知识迁移为 Apple Silicon 的高质量 Metal 内核。
推荐理由:工作把 CUDA 积累的内核优化知识通过结构化翻译层迁移到 Apple Silicon,读者可看到方法细节和可复现路径。
Berkeley AI Research 提出 ABBEL 框架,将摘要建模为自然语言信念状态并对其内容进行监督,解决传统递归摘要(context compaction)在长程交互中的性能损失。
UC Berkeley 的 Aditya G. Parameswaran 等人撰文指出,GPT-4 级能力的推理成本已从 2023 年初的约 $30 per million tokens 降到 $1 以下、部分低于 $0.10,基准推理价格中位数每年下降约 50x。
Berkeley AI Research 介绍 SPEX(Spectral Explainer)与 ProxySPEX 两种算法,利用稀疏性和低阶性等结构观察,用尽可能少的消融实验识别 LLM 特征、数据和模型内部组件中的关键交互,将交互发现规模提升到比以往方法高数个数量级。