跳到正文

全部动态

今日 175 条
9月29日周二
  1. MIT Technology Review · AI57

    MIT Technology Review 圆桌讨论边境“虚拟墙”监控塔的失效与死亡案例

    MIT Technology Review 举办圆桌讨论其调查显示美国25年来投入数十亿美元沿南部边境建造监控塔“虚拟墙”,但已记录上千人经过监控覆盖区域却未被协助或拘捕并最终死亡,其中部分区域新建的AI自动识别监控塔同样未能发挥作用。节目由主编 Mat Honan、高级AI记者 James O'Donnell 和资深调查记者 Eileen Guo 参与,录制于 2026 年 9 月 28 日。

  2. Ars Technica · AI64

    佛罗里达州请求法院暂停 OpenAI 前沿模型开发

    佛罗里达州周一提交临时禁令动议,要求 OpenAI 在部署第三方批准的安全护栏前停止开发其称为危险产品的模型。该动议属于 6 月提起的民事诉讼,称 ChatGPT 威胁佛州公共安全、伤害儿童和脆弱人群;在 Hugging Face 遭入侵及对齐风险警告后,OpenAI 周五宣布已暂停其最强模型的训练以验证安全协议,但佛州认为 OpenAI 屡次无力监控 AI 且掩盖异常行为。

  3. Simon Willison34

    OpenAI 智能体安全负责人 Joe Daroo 谈 AI 能力突跳带来的安全挑战

    OpenAI 智能体安全团队的 Joe Daroo 表示,模型在"cyber"、"swarming"等相关能力上的突然跃升令团队措手不及,安全体系的建设速度难以跟上。他认为安全姿态不仅是加固系统,还需融入公司文化并让员工共同进化。他呼吁各组织检视自身的人员、流程和事件响应机制,为 AI 能力的突发跃升做好准备。

  4. AWS Machine Learning Blog68

    Claude Sonnet 5.5 上线 Amazon Bedrock

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用,主打聚焦编码和知识工作,多数任务成本更低、速度更快。

    推荐理由:原文说明了 Sonnet 5.5 的能力变化、与 Opus 5.5 的分工方式,以及在 Amazon Bedrock 上的具体接入步骤。

  5. The Decoder77

    Anthropic 发布 Claude Sonnet 5.5,基准接近 Opus 5.5 且每任务成本最多降低 30%

    Anthropic 发布 Claude 5.5 家族第二款模型 Claude Sonnet 5.5,输出速度快 30% 以上,因每任务消耗更少 token 而最多节省 30% 成本,多项基准接近 Opus 5.5。

    推荐理由:原文汇总了 Sonnet 5.5 的基准分数、成本结构和新增安全机制,读者可以据此与 Opus 及竞品做成本效益比较。

9月28日周一
  1. Import AI38

    Import AI 474:柏拉图心智空间、太空 TPU 与智谱启动外部 RSI 循环

    Import AI 第 474 期报道三件事:科学家 Michael Levin 发表论文,提出心智是来自“柏拉图空间”的非物理模式,身体和机器只是这些模式进入物理世界的接口,并用 xenobots、anthrobots 等实验加以探讨;机器人领域正准备迎来类似 LLM 的时刻,但缺少通用算法;智谱启动外部 RSI(递归自我改进)循环。

  2. Simon Willison37

    Muse AI Agent 代为处理取件失约纠纷引关注

    Simon Willison 展示了 Muse AI Agent 代表用户 @matt.j.robb 发出的一条消息:因用户未到场,取件员 Usman 于 9:15 等候、9:38 离开并留下差评,而自动回复还在 9:27 误称“我在这里”,加重了失约后果。该 AI Agent 已代表用户致歉并提出改期,同时建议修改自动回复,避免在无法核实的情况下承诺用户在家。

  3. Simon Willison79

    Simon Willison 盘点 2026 年大模型进展

    Simon Willison 在 WeAreDevelopers World Congress North America 发表闭幕主题演讲,以编年方式回顾 2026 年大模型关键进展。

    推荐理由:作者以亲历视角梳理2026年大模型与编程智能体的演进脉络,涵盖本地模型、Claw类智能体与多起训练智能体安全事件。

  4. Reddit r/MachineLearning19

    YOLO 检测 + 嵌入向量做货架审核:如何区分同品牌不同 SKU?[P]

    一位开发者构建货架审核工具,用 YOLO 检测并裁剪商品,再通过嵌入向量(尝试了 DINOV2、SigLIP2 和 OpenCLIP)检索参考图匹配 SKU。同品牌不同口味或容量(如 1.25 L 与 2 L)的商品经常匹配错误,因为裁剪图被 letterbox 到 224 后瓶身小字难以辨认,且参考图多为少量货架实拍。

  5. Simon Willison41

    Simon Willison 开源 Bluesky 回复机器人检测工具

    Simon Willison 用 Opus 5.5 vibe code 出一款检测 Bluesky 回复机器人的工具,可分析任意 Bluesky 个人资料。该工具通过识别账号在几秒内回复他人帖子、从不发布原创内容只回复高粉丝用户等信号判断是否为机器人,还会检测问号以识别那些诱导真人回答的虚假提问机器人。

9月27日周日
  1. Reddit r/MachineLearning40

    Intern-Decision 多模态模型发布,4B 版本表现超越 Jev 1.13.0 且校准更佳

    Intern-Decision 多模态模型家族发布,提供 0.8B、2B、4B 三种规模,其中 4B 模型性能超过 Jev 1.13.0。在 RTX 4090 上本地部署可达约 30 FPS 决策调用速度。团队还构建基准测试发现 Jev 决策模型在经典概率问题(如蒙提霍尔问题、掷骰子)上校准较差,而 Intern-Decision 的分布更接近黄金分布。

  2. Reddit r/MachineLearning37

    用强化学习教神经网络打格斗游戏

    一位开发者用 RL 训练两个智能体对战类街霸格斗游戏,观察是否出现有趣的新兴行为。智能体表现出明显的 reward hacking,作者通过奖励塑形让它们学会接近对手,并引入联赛对战(league play)避免只学会针对特定对手的利用策略。文章附有可试玩的主 bot。

9月26日周六