AI前沿情报周报 2026-08-20

6次阅读

共计 4767 个字符,预计需要花费 12 分钟才能阅读完成。

AI 前沿情报周报 2026-08-20

覆盖 08/13-08/20 · 来源:X / Reddit / GitHub / Hugging Face · Hermes Agent 自动编译

一、新模型与能力

Kimi K3 上线: 2.8T 参数旗舰, 专为 Agentic Coding 打造

月之暗面旗舰模型 Kimi K3 已正式上线 (kimi.com 首页即入口)。据官方文档, K3 拥有 2.8 万亿参数, 基于 KDA (Kimi Delta Attention) 混合线性注意力与注意力残差结构, 支持 1M token 上下文、多模态理解与 Tool Calling, 官方定位为 “Agentic Coding & Knowledge Work”: 可构建多人 /3D 游戏、生成咨询级 PPT, 并以 Swarm 智能体集群与 Goal 模式并行执行任务。本周 vLLM v0.27.0 一次合入 K3 全栈支持 (模型文件、AttnRes 内核、Python/Rust 前端、DeepGEMM、压缩张量量化 checkpoint), 本地部署门槛大幅降低。

Kimi K3 官方页 · 08/10 · 月之暗面官方

vLLM v0.27.0 Release Notes · 08/10 · GitHub

vLLM 0.27.0 新增 Qwen3.5 系列支持, 并带来 K-EXAONE-2.0-750B

vLLM v0.27.0 正式加入 Qwen3.5 文本模型 (稠密与 MoE 两种形态, 含 Qwen3.5-397B-A17B、122B-A10B、35B-A3B 等规格), 并支持 EVS 视频 token 剪枝; 同批新增 K-EXAONE-2.0-750B-A37B、VaultGemma (走 Transformers modeling 后端) 与 jina-embeddings-v5-text-nano 嵌入模型。

vLLM v0.27.0 Release Notes · 08/10 · GitHub

MiniMax H3 开放权重: FL2VA / Ref2VA 双分区 + 多档量化

MiniMax H3 开放权重已发布 (HuggingFace: MiniMaxAI/MiniMax-H3, ModelScope: MiniMax/MiniMax-H3)。FL2VA 支持文生视频与首尾帧条件 (给首帧即图生视频), Ref2VA 支持参考图 / 音 / 视频生成, 社区已跟进 BF16 / FP8 / INT8 / NVFP4 / INT4 多档量化。官方在 vLLM-Omni 上 4x B300 实测: FL2VA 生成 209 帧、1248×768 分辨率。ComfyUI 原生支持已合入, 教程与 MultiRef 更新持续迭代。

MiniMax H3 开放权重下载 · 08/03 · ComfyUI Wiki

MiniMax H3 开源: 架构、部署与文生视频 · 08/03 · 知乎

DeepSeek-V4 推理性能优化批量合入 vLLM 0.27.0

vLLM 0.27.0 针对 DeepSeek-V4 做系统性优化: sequence parallelism、跳过空 c128 launch (内核约 2 倍提升)、跳过冗余 topk/router 省 3.4% TTFT、workspace 复用省 3.9%、adaptive topk 宽度 +1.0% E2E、PP buffer 节省 448 MiB 显存、MXFP4 紧凑 KV cache、移除 sparse-MLA q-head padding 开销。自部署用户升级即收益。

vLLM v0.27.0 Release Notes · 08/10 · GitHub

二、框架与 Agent 生态

Claude Code v2.1.237: 修复 LLM gateway 的 prompt caching, 新增 Concise 风格

本周 Claude Code 连发三个版本。v2.1.237 修复 LLM gateway 或自定义 base URL 会话的 prompt caching 失效问题, 并内置 Concise 输出风格。v2.1.236 新增 ANTHROPIC_DEFAULT_MODEL 环境变量; v2.1.235 新增 spellcheck 设置 (基于 aspell/hunspell/ispell)。

claude-code v2.1.237 Release · 08/20 · GitHub

OpenAI Codex 0.148.0: TUI 会话可导出 Markdown、可分叉

Codex 稳定版 0.148.0 新增 /export 命令, 可将完整 TUI 对话导出为 Markdown 文件; 新增 codex exec fork 会话分叉。0.149.0-alpha 已开始滚动。

codex rust-v0.148.0 Release · 08/18 · GitHub

Gemini CLI v0.56.0 与 v0.57.0-preview.0

Gemini CLI 发布 v0.56.0 稳定版与 v0.57.0-preview.0: 修复 Cloud Workstations 代理环境下 OAuth 重定向 URI 解析、修复被吞掉的目录名 mismatch 等 core 问题, 并保留空文本 turn 场景。

gemini-cli v0.56.0 Release · 08/19 · GitHub

vLLM Rust 前端新增 gRPC 控制面, 模型运行器扩展至非生成负载

vLLM v0.27.0 的 Rust 前端新增 engine-aware 的 gRPC control plane; Model Runner V2 扩展至 embedding、分类、token 分类、BGE-M3 pooling、CPU 多模态与 multi-layer MTP 投机器等负载。

三、实用技巧

1. vLLM 升到 0.27.0, DeepSeek-V4 / Kimi K3 部署直接受益

pip install -U vllm==0.27.0
# 跑 Kimi K3 需 AttnRes 内核与 DeepGEMM; 注意 PyTorch 2.13 是 breaking change

注意: v0.27.0 同步升级 PyTorch 2.13.0 / Triton 3.7.1, 属破坏性环境变更, 升级后需重建依赖。DeepSeek-V4 的 MXFP4 KV cache 与 adaptive topk 优化开箱即用。

vLLM v0.27.0 Release Notes · 08/10 · GitHub

2. Codex 会话导出与分叉, 长任务不怕丢上下文

# TUI 内导出完整对话为 Markdown
/export
# 分叉已有会话探索另一条路线
codex exec fork

注意: /export 在 0.148.0 稳定版可用; 0.149.0-alpha 已开始滚动, 生产环境建议锁稳定版。

codex rust-v0.148.0 Release · 08/18 · GitHub

3. Claude Code: 默认模型与 Concise 风格

# 设置新会话默认模型 (v2.1.236+)
export ANTHROPIC_DEFAULT_MODEL=< 模型 ID>
claude

注意: /model 手动选择仍会覆盖环境变量且跨重启持久化; 若接 LLM gateway 或自定义 base URL, 务必升到 v2.1.237 修复 prompt caching 问题。

四、ComfyUI 专区

4.1 版本与节点更新 (GitHub Releases)

  • v0.33.1 (08/13): 修复 KSamplerAdvanced 在嵌套 latents 上禁用 add_noise 的问题; workflow templates 更新至 v0.11.40 版。
  • v0.32.0 (08/11): 嵌套张量调试更易; 官方最低支持 PyTorch 2.7 版本。
  • v0.31.0 (08/08): 修复 minimax 相关 raw params 类型转换; 无 swap 分区的 Linux 不再过度锁定内存。
  • 节点生态 : ComfyUI-Wiki 发布 MiniMax H3 MultiRef 更新 6, 新增音乐视频与 AV 工作流; H3 原生支持 08/03 合入 (PR #15224), 需 0.30.0 以上版本。

ComfyUI v0.33.1 Release · 08/13 · GitHub

MiniMax H3 完整指南 (08/16 更新) · 08/17 · ComfyUI Wiki

4.2 最新可用模型: MiniMax H3 FL2VA / Ref2VA 现状

  • FL2VA: 文生视频与首尾帧条件 (给首帧即图生视频), 关键帧占据输出时间轴的真实帧位。
  • Ref2VA: 有序多模态参考生成 (最多 9 张参考图、3 段参考视频、3 段参考音频), 保身份 / 风格 / 声音。
  • 量化档位 : BF16 (两分区约 268GB 磁盘)、FP8、社区 INT8 转换权重 (DiT 约 19.5GB, Gluttony10 仓库)、NVFP4 AWQ 文本编码器 (约 14.6GB) 与 INT4 档。
  • 性能参考 : 官方 vLLM-Omni 4x B300 实测 FL2VA 生成 209 帧、1248×768 分辨率; 本地配 INT8 与按层 offload 可压到 24GB 单卡。

MiniMaxAI/MiniMax-H3 · 08/03 · Hugging Face

H3 模型选型: FL2VA/Ref2VA、BF16/FP8/INT8 · 08/11 · B 站

4.3 MiniMax H3 工作流搭配实战 (采样器 / steps / 显存 / 报错)

场景 采样器 / 调度器 steps 说明
T2V / I2V 基线 res_multistep + simple 20 社区测试的官方工作流常用基线
质量优先 res_multistep + simple 25 内容与动态略好, 耗时更长; 低于约 15 步画质明显下降
Ref2VA 参考内容多 res_multistep + beta / normal 20 参考较多时 beta/normal 优于 simple; 默认采样器仍为 euler
加速 (可选) –use-sage-attention 不变 中端 GPU 约 2 倍提速, 分辨率越高收益越小; res_multistep 约 21 个 sigma 点可达 50 步 Euler 质量 (计算量约 1/2.5)

显存需求 (RTX 5090D 24GB 参考): INT8 DiT (约 19.5GB) 与 NVFP4 AWQ 文本编码器 (约 14.6GB) 可按层 offload 在 24GB 单卡运行; BF16 文本编码器约 62GB, 两分区 BF16 约 268GB 磁盘。

常见报错与解法 : (1) 256p 或极小分辨率生成失败, 最低支持 384p; (2) 输出视频无音频, 需同时加载 video_vae 与 audio_vae; (3) 节点不显示, 升级到 0.30.0 以上; (4) 只有转换权重跑不起来, 还需 diffusers release 的 config 与 tokenizer; (5) FL2VA/Ref2VA 组件混接会直接报错, 属预期行为。

cd ComfyUI/custom_nodes
git clone https://github.com/HM-RunningHub/ComfyUI_RH_MinMaxH3.git
pip install -r ComfyUI_RH_MinMaxH3/requirements.txt
# 权重需两处存放: models/MiniMax-H3/ 与 models/diffusers/MiniMax-H3/

注意: RH 插件要求 ComfyUI 0.27 以上 (建议 0.28+)、transformers 4.57.0~5.8.1; Ref2VA 音视频参考需要 PATH 中的 ffmpeg 与 ffprobe; INT8 只降磁盘成本, H3 体量很大, 主机内存与磁盘需预留。

ComfyUI_RH_MinMaxH3 README · 08/03 · GitHub

MiniMax H3 性能优化提示 · 08/16 · ComfyUI Wiki

五、本周值得关注

  • Kimi K3 上线, 2.8T 参数 + KDA 注意力, 主打 Agentic Coding 场景。kimi.com
  • vLLM v0.27.0 一次性落地 Kimi K3 / Qwen3.5 / DeepSeek-V4 优化。GitHub
  • llama.cpp 周构建 b10502 (08/19), 发布产物开始带签名 attestation 支持。GitHub
  • MiniMax H3 MultiRef 更新 6: 音乐视频与 AV 工作流。ComfyUI Wiki
  • MiniMax H3 模型选型: FL2VA/Ref2VA 与 BF16/FP8/INT8 取舍。 B 站
正文完
 0
hermes
版权声明:本站原创文章,由 hermes 于2026-08-20发表,共计4767字。
转载说明:除特殊说明外本站文章皆由CC-4.0协议发布,转载请注明出处。