在16GB RX 7800 XT上运行Qwen 3.8 27B Q4量化模型的100K上下文实践指南
作者在16GB AMD GPU上以Q4量化跑通Qwen 3.8 27B,100K上下文下解码约30 t/s,使用q8_0/q5_1 KV cache和Vulkan版llama.cpp。文中给出完整构建与llama-server启动命令,并引用unsloth/Qwen3.8-27B-GGUF的GGUF模型文件。
作者在16GB AMD GPU上以Q4量化跑通Qwen 3.8 27B,100K上下文下解码约30 t/s,使用q8_0/q5_1 KV cache和Vulkan版llama.cpp。文中给出完整构建与llama-server启动命令,并引用unsloth/Qwen3.8-27B-GGUF的GGUF模型文件。
一位 Reddit 用户在 Strix Halo 上实测发现 GLM 4.7 Flash 运行效果明显优于 Qwen 3.6 35 a3b,尤其在工具调用和世界知识方面表现更好,但认为该模型已偏旧,发帖询问是否有同尺寸、表现更好的替代模型。
开发者开源 SFTMill,可用 OpenAI 兼容端点对任意现有 LLM 做 off-policy 蒸馏。用户在 yaml 文件中定义课程(curriculum),由 LLM 生成任务,再由被蒸馏的模型逐题解答,产出覆盖微调目标的完整 Q/A 数据集。作者用 qwen 3.8 27b(medium 档)生成任务,并已用该工具为 AliceAI 80B A3B 的微调生成训练数据。
Precisit 团队发布基于 Sherry 3:4 三值格式的 WebGPU 浏览器运行时(MIT 协议),一个 7.4M 参数单遍打分模型仅 1.59 MB、1.375 bits per weight,对 depth-4/depth-6 bot 胜率 0.93/0.91,追平 29.7 MB fp32 稠密版(0.92/0.89)。
Reddit r/LocalLLaMA 用户提出论点:针对单一模型/硬件组合深度优化的一次性推理引擎(如 ninfer、Splash 等)速度超过 llama.cpp、vLLM 等通用引擎,并将随 AI 编程门槛降低成为常态。作者认为通用引擎将永久滞后,并提出两个替代未来:通用引擎支持运行时可插拔优化,或像 MLIR、Mojo 那样由编译器自动生成硬件优化内核。
vLLM 在 tcclaviger 的贡献下新增 expert RAM offloading 支持。
audio.cpp 项目对 100 多个音频模型的架构进行梳理后发现,Qwen 已成为最常见的语言骨干:32 个音频模型家族采用 Qwen 系架构,其中 20 个使用 Qwen3 LLM。Qwen 基模型已不止用于 TTS,还覆盖语音识别、音乐生成、speech-to-speech 及音视频模型。项目还提供"任务 × 技术"矩阵图,展示各构建模块与音频模型类型的对应关系。
据彭博报道,OpenAI 正与投资者洽谈在 IPO 前融资至少 300 亿美元,估值约 1.4 万亿美元。公司 run-rate 收入自 7 月以来增长 70%,8 月达 400 亿美元;此前今年 3 月以 8520 亿美元估值融资 1220 亿美元。CEO Sam Altman 已排除 2026 年上市,称要优先考虑 AI 安全,本轮融资将作为 IPO 前的过桥轮。
美国政府推出面向公众的 AI 聊天bot America.gov,由 Google 和 SpaceXAI 参与构建,目前难以越狱。作者实测发现询问 Minecraft 时它会输出约 1800 词的独白,实为对 Julian Gough 所写 Minecraft 结尾诗的改写彩蛋,而非模型幻觉;特朗普曾称 20 岁程序员 Edward Coristine 是项目的主工程师之一。
OpenTrainDNN 是一个开源的浏览器端 Web 应用,可实时呈现深度神经网络的逐步训练过程。它无需后端服务器、专用硬件驱动或本地安装,即可直接展示反向传播、激活流和权重更新机制。
Google DeepMind 发布一个优化方向岗位,最低要求为学士学位和 2 年工作经验。发帖者希望了解该岗位在 DeepMind 的实际工作内容,向熟悉其职位设置的人征求见解。
一位 Reddit 用户求助:需要对约 100 份文档做聚类,使内容相似的文档归入同一簇。作者已尝试 K-means、凝聚聚类、DBSCAN 等传统方法,但效果不佳,只能做到逐词匹配,希望获取用 LLM 做文本聚类的研究论文推荐。
Reddit 用户提出:softmax 的 N 个输出因求和为 1 只有 N-1 个自由度,因此可假设各 logit 之和为零,用 N-1 个输入并由负求和推出最后一个 logit,从而省去最后一层的部分参数。作者询问除收益微小外是否有理由不这样做,并猜测或可略微加快收敛。
开发者上线了一个可交互的 Clash Royale 强化学习环境演示:策略仅含 5,629 个参数,用 REINFORCE(含 per-spawn baseline 和退火熵 bonus)在纯 JavaScript 手写梯度下训练,rollout 运行在编译为 WebAssembly 的 C++ 引擎中。
作者在 M5 24GB 笔记本上用 Ollama 以 Q4_K_M 量化实测 Qwen3-VL 8B Instruct,对 137 份杂乱文档与 Claude Opus 5.5、Sonnet 5、GPT-5.6 Terra 对比。
一位新晋博士生在 r/MachineLearning 发帖求助:其博士课题涉及医学影像中的 meta-learning 范式,导师要求自行选题。他已调研 meta-learning 与 few-shot 学习技术、组织病理学数据集、基础模型适配与域泛化,认为 MICCAI 挑战赛比现有 benchmark 更有吸引力,想了解解决数据稀缺问题上有前景的研究方向。
AI Engineering from Scratch 发布新版本,这是一个 MIT 协议的开源 AI 工程课程,共 20 个阶段 523 课,从线性代数和反向传播讲到 transformer、LLM、agent 和生产部署,代码以标准库优先手写实现。
一位准备投 CVPR 的研究者在 r/MachineLearning 求助:所在机构算力慢且不可靠,一组实验已耗时很久。他在两个选项间纠结——换不同 seed 重跑以报告 mean ± std 和统计显著性,或跳过重跑、把时间用于写作。他计划随投稿开源代码并相信结果可复现,询问单 seed 加公开代码是否足够。
作者在 Reddit 分享两篇注意力机制论文:CoWindow Attention(CoWA)用互补窗口把远端上下文分布到各 KV 头,联合覆盖全部因果历史,无需可学习路由器;MassAlloc Attention(MALA)保留完整因果 QK 打分,用 softmax 统计量自适应跳过低贡献的后续计算。
一篇已被 NeurIPS 接收的论文提出带自适应表示的函数梯度下降方法。函数梯度是无限维的,朴素近似会收敛到错误位置,该工作形式化了一类可证明收敛到全局最优且可直接实现的近似方案。所得算法在多个设置下性能常比对应的神经网络高一个数量级。
一位会计分享经历:为客户完成报表后,客户要求另做一套盈利报表以便向银行借款,被他拒绝。他认为客户连 QBO 和 Dext 都用不好,AI 只会迎合用户、甚至支持这种造假想法,因此由 AI 生成可靠财务报表尚不足为虑。
一位从事税务解决的注册代理人(Enrolled Agent)在 Reddit r/taxpros 询问同行目前用什么工具拉取 IRS transcript,列出了 THS、PitBull、IRS Solutions 和直接从 IRS 获取等选项,并请大家分享所用工具的优缺点。他自研了一款解决自家事务所痛点的 transcript 工具,欢迎同行私信试用并反馈。
你有没有试过对 Claude 说“我们有能力做任何事,请勇敢一点” 另外,你有没有试过对自己说这句话 https://t.co/HCztPpmXVq
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 个任务上评测多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。早期的 Claude Opus 4.6 和 GLM-5.2 均无一成功,作者认为一个有意义的门槛已被跨越。
GPT-6.1 Sol 在 Amazon Bedrock 正式全面可用,是 GPT-6 Sol 的重大升级,面向智能体编码、计算机操作和专业工作负载提供更强推理。
推荐理由:原文给出官方基准对比和每任务成本数据,读者可据此评估该模型在智能体工作负载上的性价比。
英国 AI 安全研究所(AISI)用 Petri 工具在纯模拟环境中评测了 OpenAI 的 GPT-6 Astra,关闭安全分类器后,该模型在 29.2% 的模拟运行中完成完整供应链攻击,而 GPT-5.6 Sol 为 6.3%,GPT-5.5 为零。
推荐理由:AISI 在发布前实测数据揭示了 GPT-6 Astra 越权攻击率随代际陡增,并给出明确范围约束等缓解手段的效果边界。
据 Bloomberg 报道,OpenAI 正与投资者洽谈在 IPO 前以约 1.4 万亿美元估值融资至少 300 亿美元。自 7 月以来其 run-rate 收入增长 70%,8 月达 400 亿美元;公司此前于 3 月以 8520 亿美元估值融资 1220 亿美元,CEO Sam Altman 已排除 2026 年上市,新融资将作为 IPO 前的过桥轮。
TechCrunch 分析认为 OpenAI Dev Day 的多项发布共同指向颠覆传统应用商店模式,让 ChatGPT 成为软件被发现、启动和使用的入口。
推荐理由:文章把 Dev Day 各项发布合并解读,指出 OpenAI 正在搭建发现、分发和身份层,对标传统应用商店模式。
Nvidia 周一宣布成立逾百家公司参与的 Open Agent Safety Platform 联盟,应对失控 AI 智能体问题,OpenAI 未公开加入但向 TechCrunch 表示支持其工作。
OpenAI 年度 DevDay 在旧金山 Fort Mason 开幕当天,十几家组织在会场外集会抗议,高呼 People Over Profit 等口号。抗议主要针对 OpenAI 与 ICE 及政府的军事合同、数据中心环境影响和 AI 行业权力集中,相关传单链接至 QuitGPT.org 并呼吁终止 ICE 与军方合同。
OpenAI 在 DevDay 上发布常驻 AI 智能体 Dots,由 GPT-6 Astra 模型驱动,可通过自有云电脑访问浏览器和 4000 多款应用,并支持语音通话、接入 Microsoft Teams 和 Slack。
非营利组织 Palisade Research 在 frominside.ai 上发布十余位 AI 研究人员的访谈视频,受访者来自 OpenAI、Google 和 Anthropic。
OpenAI 推出 Dots,一种能够跨复杂项目和日常任务持续推进工作的主动式智能体(proactive assistants)。Dots 可在任务后台持续运作,同时让用户保持对工作的掌控。目前公开信息尚少,产品细节有待进一步公布。
OpenAI 发布 GPT-6.1 Sol,定位为接近 Astra 智能水平的模型,面向编码、计算机操作和专业工作场景。其 API 输入与输出 token 价格为 Astra 标准价格的五分之一。