共计 5016 个字符,预计需要花费 13 分钟才能阅读完成。
AI 前沿情报周报 2026-08-27
覆盖 08/20–08/27 · 来源:GitHub / vLLM Releases / ComfyUI · Hermes Agent 自动编译
一、新模型与能力
Qwen3.8-Flash-Next:Qwen 团队新基础模型开源
8/24,Qwen 团队在 GitHub 上线 Qwen3.8-Flash-Next 仓库(3 天获 115+ star),官方定位为 Qwen 系列新一代基础模型(foundation model)。当前仓库以模型权重与推理说明为主,Flash 后缀暗示主打低延迟部署。
QwenLM/Qwen3.8-Flash-Next · 08/24 · GitHub
DeepSeek V4 进入开源推理栈:sparse MLA 端到端打通
vLLM v0.28.0(8/26)宣布 DeepSeek V4 的 sparse MLA 已在普通 decode、MTP 与 DSpark 投机解码三种路径端到端可用,并补齐 AMD Quark NVFP4 量化支持与 reasoning-effort 提示词映射。对自部署用户来说,这意味着 DeepSeek V4 在 vLLM 上已具备生产级推理条件。
vLLM v0.28.0 Release Notes · 08/26 · vLLM Releases
Kimi-K3 专项性能冲刺:共享专家分片每卡省 ~17GiB
vLLM v0.28.0 同时包含对 Kimi-K3 的大规模优化:Decode Context Parallel(DCP)、fused FlashKDA decode/prefill 内核、GEMM-RS 序列并行、合并 all-gather(内核级 1.5~3 倍提速)、自适应投机 token 预算(DSpark TTFT 改善约 60%)、可选共享专家分片(每 GPU 节省约 17GiB 显存),并正式支持 ROCm。
vLLM v0.28.0 Release Notes · 08/26 · vLLM Releases
腾讯 WeMM-Embedding:通用多模态 embedding 家族
8/25 腾讯开源 WeMM-Embedding(220+ star),定位通用多模态 embedding 模型家族,可同时编码文本与图像,适用于检索、RAG 与多模态匹配场景。
Tencent/WeMM-Embedding · 08/25 · GitHub
MiniMax 官方仓库周内高频更新
MiniMax 官方组织周内更新密集:MiniMax-Code-Plugins(8/27)、MiniMax-Coding-Plan-MCP(8/20,101★)、cli(8/21,2074★);视频生成旗舰 MiniMax-H3 仓库 7167★(8/15 更新)。H3 生态细节见第四节。
MiniMax-AI 官方组织 · 08/27 · GitHub
二、框架与 Agent 生态
Claude Code v2.1.247:新增 SendFeedback 反馈工具
8/25-8/26 连发 245/246/247 三个版本。v2.1.247 新增 SendFeedback 工具:会话出错时 Claude 可起草反馈报告,经 /feedback 发送(可用 feedbackDrafts 设置关闭);spinnerTipsOverride 支持 org 级轮换提示(含 {id, text, cooldownSessions, priority} 字段与 tipsFile/label)。
anthropics/claude-code Releases · 08/26 · GitHub
Codex CLI rust-v0.150.0:任务间 @ 引用
8/26 发布 rust-v0.150.0:可在终端用 @ 提及引用其他 Codex 任务,让 agent 读取 / 创建 / 发送消息给任务;/copy 支持整段回复、代码块、引用的选择器;未命名终端任务自动获得描述性标题,/rename 提供可编辑建议标题。
openai/codex Releases · 08/26 · GitHub
Gemini CLI v0.57.0 稳定版:OAuth 与 IDE 连接修复
8/25 v0.57.0 稳定版发布,修复 Cloud Workstations 代理场景下 OAuth 重定向 URI 解析、IDE 连接目录不匹配等问题;8/26 nightly 继续迭代。
google-gemini/gemini-cli Releases · 08/25 · GitHub
OpenHands v1.15.0 与 CrewAI 1.15.17 周内迭代
开源 agent 框架本周继续高频发版:OpenHands v1.15.0(8/21),CrewAI 1.15.17(8/20,1.15.15/1.15.16 亦在 8/12-8/14 密集发布)。
All-Hands-AI/OpenHands Releases · 08/21 · GitHub
setfree:把 Claude Code / Codex 接到任意 LLM 提供商
mindsdb/setfree(8/20,59★):一条命令让 claude、codex 等任意 coding CLI 自由对接任意 LLM 提供商,适合想绕过厂商绑定、用本地或第三方模型跑 coding agent 的用户。
mindsdb/setfree · 08/20 · GitHub
三、实用技巧
技巧 1:vLLM 升级到 v0.28.0,白嫖 K3/V4 优化
本周 vLLM v0.28.0 的大头优化(DCP、fused FlashKDA、共享专家分片、自适应投机预算)大多对用户透明,升级即可受益;Kimi-K3 共享专家分片需开启 expert parallel 才生效。
pip install -U vllm
vllm serve <model> --gpu-memory-utilization 0.9 --max-model-len 32768
注意:升级后建议清一次推理缓存并核对 kernels 编译日志;共享专家分片每卡省约 17GiB,但仅在启用 expert parallel 的 MoE 场景生效;DeepSeek V4 的 sparse MLA 需配合对应量化(如 AMD Quark NVFP4)使用。
vLLM v0.28.0 · 08/26 · vLLM Releases
技巧 2:llama.cpp 日更节奏,KV cache 新增 token 追踪
llama.cpp 8/26 一天连发 b10638/b10639/b10642 三个构建。b10642 为 KV cell 加入 token ID 追踪(PR #27762),长上下文 + 缓存复用场景命中率更高;注意 macOS KleidiAI 构建当前被临时 DISABLED(PR #23780)。
llama-server -m <model>.gguf -ngl 99 -fa on -c 16384 --cache-reuse 256
注意:–cache-reuse 控制 KV 缓存复用窗口大小,值越大长对话越省算力但吃内存;b10642 的 token ID 追踪让缓存命中判断更准,建议长上下文用户尽快升级。
ggml-org/llama.cpp Releases · 08/26 · GitHub
技巧 3:llama.cpp 投机解码参数参考
本地单卡跑大模型时,投机解码(speculative decoding)是性价比最高的提速手段之一。llama.cpp 原生支持草稿模型投机:
llama-cli -m <main>.gguf -ngl 99 --draft-max 16 --draft-min 5 --draft-p-min 0.9 -c 8192
注意:草稿模型必须与主模型词表一致(同系列小尺寸即可);–draft-max 过大在短生成场景反而拖慢;–draft-p-min 控制草稿接受阈值,0.9 附近是社区常用起点,需按模型实测微调。
llama.cpp 官方文档 · 08/26 · GitHub
四、ComfyUI 专区
4.1 版本与节点更新
ComfyUI v0.34.0(8/26)核心变化:
- 新增 MiniMaxH3AddGuide 节点:可在任意帧锚定图像 / 音频引导(PR #15439),H3 工作流的多参考引导从此无需外部 hack;
- 修复 MiniMax Music 在非动态显存模式下的运行问题;
- kijai 提交 Gemma4 文本生成提速(PR #15054);
- 前端升级至 comfyui-frontend-package 1.49.6。
Comfy-Org/ComfyUI v0.34.0 · 08/26 · GitHub Releases
本周新建的 H3 生态节点(GitHub 新仓库,按 star 排序):
- Comfyui-MMH3-UltimateUpscale(8/22,109★):VRAM 受限环境下长视频高分辨率升采样;
- ComfyUI-H3-AudioRefine(8/21,78★):冻结视频 latents、继续生成音频的实验节点;
- ComfyUI-Photoshoot(8/21,64★):人物一次建模、批量换景连拍;
- ComfyUI-MiniMaxH3-TimelineDirector(8/22,27★):可编辑参考媒体时间线导演节点;
- ComfyUI-MiniMax-H3-PDD-Acc(8/26,22★):官方(alibaba-pai)MiniMax-H3 8 步 PDD Acc LoRA 的 ComfyUI 封装。
GitHub 仓库搜索(created>08/19, stars 排序) · 08/26 · GitHub Search
4.2 最新可用模型
MiniMax H3 FL2VA / Ref2VA 现状:H3 主仓库 7167★(8/15 更新)。本周生态爆发点集中在 Ref2VA(参考图 / 参考媒体 驱动视频生成):Director-Cut-Studio、TimelineDirector、Motion-Context-Auto-Chain 等新节点全部围绕 Ref2VA 的参考媒体时间线与多镜头导演工作流;FL2VA(首尾帧驱动)方向由 MiniMaxH3AddGuide 提供任意帧锚定能力补强。官方 8 步 PDD Acc LoRA 已进入 ComfyUI 生态(8/26),生成步数成本大幅下降。
MiniMax-AI/MiniMax-H3 · 08/15 · GitHub
其他可用模型 / 工具:MiniMax Music3(8/14,733★)音乐生成模型,v0.34.0 已修复其非动态显存运行问题;wide-trace/open-higgsfield(8/26,565★)图像 / 视频生成一体化工作台;seedleap/zing-world-model(8/25)实时交互世界模型 Zing-0.5。
MiniMax-AI/MiniMax-Music3 · 08/14 · GitHub
4.3 MiniMax H3 工作流搭配实战
以下为社区常用参数参考区间(RTX 5090D 24GB 场景),具体以模型卡与节点说明为准:
| 方案 | 采样器 / steps / denoise | 显存需求 | 常见报错与解法 |
|---|---|---|---|
| 标准文生视频 | euler / 20-30 steps / CFG 1-4,denoise 0.9-1.0 | 24GB 可跑 720p 短片段 | OOM:降分辨率或帧数;采样器报错换 dpmpp_2m |
| 8 步 PDD Acc LoRA | dpmpp_2m / uni_pc,steps 固定 8 / CFG 1-2 | 较标准流程更低 | steps 高于 8 易过曝,严格按 LoRA 卡步数执行 |
| Ref2VA 参考图驱动 | euler / 20-30 steps / denoise 0.55-0.8 | 24GB 建议单参考图 + 短时长 | 首帧漂移:用 MiniMaxH3AddGuide 锚定引导帧 |
| 长视频升采样 | UltimateUpscale 分块,参考帧按间隔抽取 | VRAM 受限可跑长片 | latent 尺寸不匹配:保持 2x/4x 对齐比例 |
| 音频引导生成 | H3-AudioRefine 冻结视频 latent 续音频 | — | 音画不同步:检查音频 latent 长度与视频帧对齐 |
注意:以上数值为社区反馈汇总的参考区间,非官方基准;首次跑通建议先以 8 步 PDD LoRA + euler 组合验证管线,再逐步叠加 Ref2VA 引导与升采样节点。
ComfyUI H3 生态节点汇总 · 08/26 · GitHub Search
五、本周值得关注
- setfree(8/20):一条命令让 coding CLI 自由接任意 LLM 提供商;
- rome-os/rome(8/23,360★):Agentic OS,把 agent 当操作系统用;
- context-labs/whip(8/20,117★):Go 编写的快速 coding-agent harness;
- modelprint(8/21,96★):指纹识别 OpenAI 兼容端点背后到底是哪个模型;
- Qwen3.8-Flash-Next(8/24):Qwen 新一代基础模型仓库上线。