据 ai987.cn 于 2026 年 8 月 28 日收到的消息 ‣ 截至2026年8月,开放权重AI模型市场已呈现明显分层:面向编程与长程代理的巨型前沿模型、极具价格优势的API模型,以及普通团队可实际部署的200亿至300亿参数实用模型三大梯队并存。单纯追逐基准测试分值而忽略硬件、许可证与工作流适配,往往只能得到无法落地的“榜单奖杯”。

本榜单涵盖GLM-5.3、DeepSeek V4、Kimi K3、Qwen3.8、MiniMax M3、NVIDIA Nemotron 3.5 Lightning与Gemma 4等核心模型,评估维度超越编程排行榜,综合考量能力、上下文、多模态、部署自由度、许可证、价格及工程落地现实性。需特别澄清,“开源”常被泛指为可下载权重的模型,但权重与源代码并非同一概念。文中将严格区分开放权重、可下载与开源等术语:DeepSeek V4采用MIT许可证,Kimi K3使用专属K3许可证,Qwen3.8各变体许可证不同,Gemma 4采用Apache 2.0,而GLM-5.3的最终权重与许可证截至8月26日仍在待定。
快速结论:对大多数构建者而言,DeepSeek V4-Pro是最稳妥的开放权重推荐,兼具强推理与编程能力、已发布权重及极低API定价;GLM-5.3是编程专家首选,Z.ai报告其在编程与网络安全基准上领先,但官方权重尚未发布;Kimi K3是长上下文多模态代理的重量级之选;Qwen3.8因包含2.4万亿旗舰与270亿实用模型而成为家族最全;MiniMax M3是原生多模态、百万上下文与编程三合一的最佳开放替代;Nemotron 3.5 Lightning与Gemma 4则是巨型模型过剩时的高效实用之选。
DeepSeek V4-Pro:综合平衡最佳
DeepSeek V4-Pro采用1.6万亿总参数MoE架构,激活参数约490亿,支持百万级上下文窗口、工具调用与结构化输出。其核心优势非参数规模,而是能力与经济性的结合:当前API定价为每百万缓存未命中输入0.435美元、输出0.87美元,Flash版更低至0.14与0.28美元。在编程、推理与代理任务上表现足以成为测试闭源模型前的默认开放基准。弱点在于物理部署门槛高,1.6万亿参数非个人桌面可承载,多数团队需依赖托管或多GPU集群。
GLM-5.3:开放编程最强竞争者
GLM-5.3保持GLM-5.2基座,通过规模化后训练提升。Z.ai公布数据显示,其在Terminal-Bench 2.1得分88.2、Terminal-Bench 3.0得分28.3、DeepSWE v1.1得分66.9,并在CyberGym大幅领先。但可用性受限:官方称权重将在安全评估后发布,截至8月26日仍显示“即将推出”。目前可通过Z.ai编程计划(Lite层月费12.60美元)托管体验。
Kimi K3:重量级多模态开放模型
Kimi K3号称2.8万亿参数、百万Token上下文、原生视觉,专注长程编程、知识工作与推理。完整权重已可下载,区别于GLM-5.3的等待状态。但2.8万亿规模对多数团队仍属集群级部署,普通工作站难以驾驭。API定价显著高于DeepSeek:未缓存输入3美元、输出15美元/百万Token,缓存命中输入0.30美元。
Qwen3.8-2.4T-A95B:最大开放旗舰
Qwen3.8家族提供双重答案:2.4万亿旗舰对标Qwen-Max,270亿模型面向普通开发者。旗舰版面向编程、专业工作、科研与长程代理任务,两模型均在Hugging Face与ModelScope开放。注意下载版检查点与托管版能力可能不一致,后者可能包含托管工具与多模态行为。
MiniMax M3:最佳开放多模态替代
MiniMax M3为4280亿参数原生多模态MoE,激活参数约230亿,支持文本、图像、视频输入及百万上下文。其稀疏注意力架构专为长上下文效率设计。生态已支持vLLM、SGLang、Transformers、KTransformers、Unsloth本地部署,并提供OpenAI兼容vLLM路径。权衡在于体量仍远超单张消费级GPU,个人开发者更适合托管或小模型。
Qwen3.8-27B:最佳实用本地旗舰
270亿检查点可即时下载,官方提供Transformers、SGLang、vLLM、TokenSpeed部署示例,适配工作站、私有助手或本地原型。虽无巨型模型极限上限,但能真正纳入普通团队硬件规划,是“想拥有并运行开放模型”的首选短名单。
NVIDIA Nemotron 3.5 Lightning:长驻代理高效专家
300亿参数MoE、约30亿激活参数,专为高吞吐、低延迟的长驻代理设计。开放权重、数据与训练配方(OpenMDW-1.1许可)。并非追求最大模型竞赛,而是让专用工作者廉价、快速地持续运行。NVIDIA发布激进量化工作(如NVFP4),在接近BF16基线精度下大幅压缩体积。在路由架构中,可承担分类、抽取、常规工具调用与重复代理循环,将高难度推理留给强模型,更适合作为基础设施而非通用助手。
Gemma 4:最高效开放家族
Google提供E2B、E4B小模型、260亿MoE与310亿稠密模型多规格,全系支持多模态与256K上下文,Apache 2.0许可。260亿-A4B检查点兼顾多模态与可控激活参数。支持vLLM、SGLang服务,Hugging Face量化生态快速增长。虽非8月编程基准绝对王者,但在许可证、硬件适配与端侧部署上最稳妥。Gemma家族下载量8月突破十亿。
DeepSeek V4-Flash:最低成本开放工作者
V4-Pro小型兄弟,2840亿总参数、约130亿激活参数、百万上下文、工具调用与JSON输出。API定价0.14/0.28美元/百万Token,成为分类、摘要、抽取、编程辅助及非强推理代理步骤的明显路由层。支持OpenAI与Anthropic兼容API,且为Responses API与Codex集成当前支持模型。
GLM-5.2:成熟开放基线
虽非最新最激动人心,但作为GLM-5.3基座仍具参考价值。Z.ai确认5.3同基座、靠后训练提升。团队若需成熟检查点而非等待新模型,可优先考量。也为新模型宣称提供基准:对比5.2往往比仅对比闭源前沿更能揭示真实提升。
编程能力横评
厂商自报Terminal-Bench与软件工程结果显示:GLM-5.3在Terminal-Bench 2.1得88.2,Kimi K3得88.3,DeepSeek V4-Pro得87.9,Qwen3.8-Max得86.6。为厂商同表自报数据,仅供方向参考。
推理与科研:分场景取胜
DeepSeek V4-Pro定位通用推理、编程、数学与世界知识;Kimi K3融合推理、原生视觉与百万上下文;GLM-5.3聚焦长程工程与代理;Qwen3.8覆盖科研、专业工作与代理执行。实用建议:通用科研选DeepSeek V4-Pro,长视觉上下文选Kimi K3,需全规格家族选Qwen3.8,软件工程科研关注GLM-5.3。
多模态:重型选Kimi或M3,轻量选Gemma 4
Kimi K3与MiniMax M3是原生视觉与超长上下文的重型开放之选;Gemma 4将多模态下放至小模型并采用Apache 2.0。大规模多模态代理研究选前二,产品落地无集群资源选Gemma 4。
本地部署:打破“开源即本地”幻觉
Kimi K3、DeepSeek V4-Pro、Qwen3.8-2.4T、MiniMax M3均为严肃硬件工程;GLM-5.3权重未发。真正实用的本地模型为Qwen3.8-27B、Gemma 4家族、Nemotron 3.5 Lightning,视硬件与量化策略而定。最佳本地模型往往非榜首,而是适配显存、吞吐与运维预算者。
价格:开放权重不等于免费
自建意味着GPU、电力、散热、存储、网络、工程与维护成本。低用量下托管API可能更廉价。参考价快速变动,核心在于识别模式:DeepSeek极致内卷价格,Kimi溢价旗舰,小模型靠消除API依赖竞争而非基准分。
许可证:不可忽视的细节
DeepSeek MIT、Kimi专属、Qwen分变体、Gemma Apache 2.0、Nemotron OpenMDW-1.1、GLM-5.3待定。切勿因文章称“开源”即投入商业敏感负载,须阅读实际许可证、使用限制、再分发条款及提供商特殊要求。开放权重、开源、免费API、商业托管许可为四个独立问题。
选型指南
追求综合平衡、已验证权重与低成本选DeepSeek V4-Pro;编程与长程工程优先、接受托管等待权重选GLM-5.3;长上下文、视觉与大规模代理为核心选Kimi K3;需巨型开放旗舰且有基建选Qwen3.8-2.4T;原生多模态、长上下文与编程三合一选MiniMax M3;本地落地优于极限能力选Qwen3.8-27B;持久代理需快速专用工作者选Nemotron 3.5 Lightning;许可证、硬件效率与端侧多模态最重要选Gemma 4;高吞吐、非强推理任务选DeepSeek V4-Flash。
8月开放AI格局变化
本月变化超越常规发布周期:DeepSeek推V4-Pro开放,Kimi K3将开放规模推至2.8万亿,阿里开放Qwen Max层级,Z.ai推GLM-5.3冲顶编程与网安榜,MiniMax M3带来原生多模态与百万上下文,NVIDIA推高效300亿-30亿Nemotron服务长驻代理。更大变化是开放AI不再单一梯队,而是巨型前沿、Flash高效、编程专精、多模态代理、本地小模型并存。2026年底的明智选择,是将模型与负载、许可证、部署预算匹配,而非将开源视为单一性能等级。
综合自网络信息