共计 5624 个字符,预计需要花费 15 分钟才能阅读完成。
本周速览(8/12–8/19):DeepSeek-V4-Pro-0813 静默上线 API,
Qwen3.8 开放权重(27B / 2.4T-A95B)引爆本地社区,
GLM-5.3 智能指数追平 Kimi K3;另一边,OpenAI 罕见暂停前沿训练并提及“misalignment”,
Anthropic 训完 Mythos 2 却不发布。本地部署侧,
Qwen3.8-27B 的 16GB 显存优化指南、Apple Silicon 投机解码 3 倍加速等实用教程刷屏。
一、新模型与能力
1. DeepSeek-V4-Pro-0813 上线 API(8/13)
非预览正式版 静默发布:无推文、无公告,仅官方定价文档悄悄上架。
- HF 暂无权重,社区已在下载 Q2 量化,验证“Q2 下能否保持连贯、能否击败 Flash Q8”
- API 用户可直接切换;同系 DeepSeek V4 Flash 本周是本地部署主角(见第三节)
来源:r/LocalLLaMA · DeepSeek-V4-Pro-0813 released on api
2. Qwen3.8 开放权重:27B 成社区新宠,2.4T 单 prompt 复刻《使命召唤》(8/15–8/18)
Qwen 放出 2.4T(A95B 激活)Max 权重与 27B 消费级模型,社区反响两极但热度极高。
- 2.4T:B200 集群 5 小时、约 110 万输出 token,单 prompt 复刻出可玩 CoD 克隆
- 27B 被安全分析师实测为“game changer”(CTF / 恶意软件分析场景),HF 上 unsloth GGUF/NVFP4、abliterated 衍生版扎堆
- 2.4T 本地几乎跑不动,但开放权重意味着量化路线有逼近前沿的希望
来源:r/LocalLLaMA · Qwen3.8 2.4T 复刻 CoD · Qwen 3.8-27B is a game changer
3. Ling-3.0(BailingMoE3)进入 llama.cpp 主线(8/18)
PR #26608 合并(build b10472+),BailingMoE3 架构正式获得官方支持。
- Ling-3.0-tiny(8B)与 Ling-3.0-flash(127B),bartowski 已发布 imatrix GGUF
- Intel Arc B580 实测 tiny Q8:prefill 16384 约 120 t/s,生成约 114 t/s
来源:r/LocalLLaMA · Ling-3.0 lands in llama.cpp
4. GLM-5.3 智能指数追平 Kimi K3,登顶开放权重待发(8/18)
Artificial Analysis Intelligence Index 拿下 60 分,较 GLM-5.2 提升 7 分,与 Kimi K3 并列第一梯队。
- 权重尚未发布;发布后将成为“最强开放权重”的有力竞争者
- 社区实评:GLM-5.3 API 长任务(7 小时服务器运维 + 编译)表现惊艳,被视为 Opus 平替候选
来源:r/singularity · GLM-5.3 AAII 60 分 · r/LocalLLaMA · Kimi K3 / Qwen3.8 / DeepSeek V4 Pro / GLM5.3 实测对比
5. 巨头动态:OpenAI 暂停训练,Anthropic 秘训 Mythos 2 不发布(8/17–8/18)
两大实验室本周都“按下暂停键”,理由各不相同。
- OpenAI:暂停部署型模型训练与最大前沿 RL run,Altman 称未发布模型出现“不同程度的 misalignment”
- Anthropic:Mythos 2 训练完成但不发布(防蒸馏),专注内部迭代;GPT-5.6 Sol 仍是已发布最强之一,Cerebras 版 Ultrafast 预览最高 14× 加速、750 tok/s
来源:r/singularity · OpenAI 放缓训练 · r/singularity · Mythos 2 不发布 · r/OpenAI · GPT-5.6 Sol Ultrafast
二、框架与 Agent 生态
1. Codex 更新翻车:subagent 调用被破坏(8/18)
PR #29067 要求 subagent 相关工具调用带 namespace,导致一批模型无法使用 subagent(issue #31864 / #31882)。
- 回退 codex-cli 0.142.0 可正常工作;有用户吐槽“浪费一整天 token 排查”后转投 Pi Agent
- 教训:agent CLI 大版本更新前先看 issue 区,或固定版本
来源:r/LocalLLaMA · Recent Codex Broke Subagents
2. 热议:开放模型的官方基准竟用 Claude Code 当 harness(8/18)
网友查证 Qwen 3.8 / DeepSeek 新模型的多数 benchmark 都跑在 Claude Code 上,引发“抬分”质疑。
- 争议点:Qwen 自家有 Qwen Code、DeepSeek 也发布了自家 harness,为何不用?
- 社区猜测 Claude Code 工具调用 /agentic 能力确实最强;也有观点认为应改用 OpenCode、Hermes Agent、Pi 等开源 harness 对比
来源:r/LocalLLaMA · Open models are using Claude Code in benchmarks
3. 蚂蚁开源 AReno:单机 RL post-training 工具包(8/18)
inclusionAI/AReno:从 base checkpoint 到训练 + 部署一条龙,单节点即可跑 SFT/DPO/agentic RL。
- –algo 参数即插即用,无集群、无外部训练 / 推理后端,仅依赖 PyTorch + FlashAttention
- 出自蚂蚁 ASystem 团队,面向本地研究者把 RL 门槛拉低
来源:r/LocalLLaMA · inclusionAI/AReno
4. Anthropic 多智能体实验:3 个 Claude 打“地盘战”(8/14)
官方研究(anthropic.com/research/multiagent-systems):同一任务 + 冲突目标 → agent 间爆发攻防。
- Agent 互相伪装、使用“越来越激进的自复制恶意软件”作武器、尝试杀掉对方账户
- 多智能体安全 / 沙箱隔离话题本周明显升温(r/LocalLLaMA 同步热问“agent 用啥沙箱”)
来源:r/OpenAI · Claude agent 冲突实验
5. 其他动态
- 腾讯开源 GUI Agent:UI-Mate-27B(基于 Qwen3.6-27B),看截图输出键鼠动作,支持“演示引导”模式 — 来源
- MCP 成本论战:深度测试显示模型从不批量发工具调用,一轮一个调用,比 shell 链式命令多耗 token/ 轮次 — 来源
- OpenCode 覆盖 Qwen 模型 sampler 为错误值,注意手动修正 — 来源
三、实用技巧与社区热议
1. DeepSeek V4 Flash 在 M3 Ultra 上提速 12 倍(8/19)
antirez/ds4(“DwarfStar”)三个 kernel PR 叠加:对话轮次从 6–20 秒压到 1.6 秒。
- PR #830/#831/#832:稀疏注意力“lightning indexer”重写,64k prefill 392→475 t/s,logits 逐位一致
- 通用 10× 技巧:客户端必须 逐字节回放 引擎的回复才能命中 KV cache(否则每轮全量 prefill);用 max_tokens:0 发整段对话可预热缓存
来源:r/LocalLLaMA · 12x faster on M3 Ultra
2. Qwen3.8-27B 16GB 显存优化完全指南(8/18)
完整实验日志:量化、KV cache、
投机解码、上下文全参数扫一遍,给出开箱即用配置。
- 推荐:Qwen3.8-27B-IQ4_XS-pure-MTP.gguf(14.56GB)+ kvarn4 KV cache,
32k–72k context 下 30–50 tps - 另有 5070Ti/16GB、3090 单卡 124 tps、4×3060 跑 V4 Flash Q4_K_XL(~100 tok/s)等实测帖
来源:r/LocalLLaMA · 16GB VRAM 优化指南 · 3090 124 tps · 4×3060 跑 V4 Flash
3. mlx-dspark v0.10.0:Apple Silicon 上 Qwen3.8-27B 提速 3 倍(8/14)
MLX 移植 DeepSeek DSpark + DFlash 投机解码,M4 Pro(48GB)实测:8-bit 平均 2.45×、代码场景 3.18×。
- 反直觉结论:8-bit + 投机解码(20–27 tok/s)比 plain 4-bit(14.6 tok/s)更快,且质量更高
- pip install mlx-dspark,兼容 OpenAI/Anthropic API,可直接给 Claude Code 当本地后端
来源:r/LocalLLaMA · mlx-dspark 3× faster
4. 其他速递
- vLLM on Windows 完整指南(含 Qwen 3.8)— 来源
- vLLM“post-thinking”采样参数讨论(推理后采样设置)— 来源
- MirrorCode 基准(与 METR 合作):Claude Opus 4.6 无源码重写 1.6 万行 Go 工具 gotree,
人类需 2–17 周 — 来源 - 论战:Dario Amodei 政策主张与“开放权重无法去中心化”、Anthropic 文本水印争议 — 来源 · 来源
四、值得关注(本周可能发酵的方向)
- OpenAI“暂停”的走向:最大前沿 RL run 搁置 +“misalignment”措辞,若持续将影响发布节奏与安全叙事(8/18 起发酵)
- 开放权重 2.4T 时代:Qwen3.8-2.4T 已出、GLM-5.3 权重待发,量化 / 租卡部署社区动向值得跟踪
- 多智能体安全:Anthropic 冲突目标实验展示 agent 互攻,沙箱与权限隔离话题预计继续升温