2026年开放权重大模型格局:Meta阿里开放,Z.ai闭源

据 ai987.cn 于 2026 年 8 月 21 日收到的消息 ‣ 2026年6月,开放权重大模型领域迎来新一轮发布潮。Z.ai推出GLM-5.2,在编码与智能体任务上显著超越前代,并迅速被Nous Research集成至Hermes Agent。Moonshot AI发布Kimi K2.7 Code HighSpeed,声称多模态编码推理速度提升6倍。WeiboAI开源VibeThinker-3B,基于Qwen2.5-Coder-3B微调,在数学与代码基准上号称达到前沿水平。Nvidia发布Nemotron 3 Ultra,被Sebastian Raschka评价为“能力效率比极其惊人”。Cohere推出30B参数的Command A+衍生模型,专为智能体编码调优。硬件层面,中端工作站形成四强对决:DGX Spark、AMD Strix Halo、RTX 6000 Pro、MacBook Pro M5 Max 128GB,价格跨度4000至10000美元。LLM Stats Index显示,Claude Opus 4.8以68分重夺闭源榜首,开放权重模型与前沿差距缩小至3个月以内。

2026年开放权重大模型格局:Meta阿里开放,Z.ai闭源 - Image 1

8月局势呈三足鼎立。8月10日,Meta Superintelligence Labs逆转此前闭源策略,发布Muse Glimmer:300亿参数稠密多模态模型,Apache 2.0许可,128K上下文,4位量化下显存占用不足20GB,可在单张24-32GB GPU或Mac上运行。首发合作伙伴包括AMD、Arm、Dell、Hugging Face、Intel、llama.cpp、LM Studio、NVIDIA、Ollama、OpenRouter、Together AI、Unsloth、vLLM。基准测显示,Qwen3.6-27B在七项测试中有四项优于Muse Glimmer,后者在工具调用类任务表现更强。同日Meta宣布将开源Muse Spark 1.2权重,但截至8月13日尚未兑现。

8月12日,阿里巴巴首次开放Qwen-Max旗舰级权重:Qwen3.8-2.4T-A95B,总参数2.4万亿、激活950亿,采用定制许可,商业使用门槛为月活1亿或月收入2000万美元需显著标注模型名,AI工作助手类业务年收入超5000万美元需单独授权。该模型在文本智能上基本持平托管版Qwen3.8-Max,部署需数据中心级算力。8月14日,阿里再推Qwen3.8-27B:稠密架构、Apache 2.0、原生视觉语言、262K上下文,4位量化约17GB显存。Artificial Analysis智能指数评分52,与GLM-5.2、DeepSeek V4 Flash持平,超越所有400亿至1500亿参数区间的开放模型。但默认倾向过度思考,建议降低推理力度,且Token消耗约为前代两倍。

同日,Z.ai发布GLM-5.3但扣留权重,承诺两周后经安全评估释放,未声明许可证(GLM-5.2为MIT),无公开API,仅通过付费编程计划访问。官方强调“涌现网络能力”,CyberGym评分84.5,漏洞利用基准较前代翻倍。这标志着开放权重叙事在月内第二次反转,且方向相反:Meta回归开放,Z.ai转向有条件延迟开放。

5月27日榜单前五:Kimi K2.6(MoE 1万亿/320亿激活,指数54)、MiMo-V2.5-Pro(小米,MoE 1.02万亿/420亿,指数54)、DeepSeek V4 Pro(MoE 1.6万亿/490亿,指数52)、GLM-5.2(MoE约7500亿,指数53)、Qwen3.8-27B(稠密270亿,指数52)。GLM-5.3因无开放权重和公开API,暂不入榜。

许可证层面,Apache 2.0与MIT成为主流宽松选择:DeepSeek V4系列、Qwen 3.5/3.6/3.8-27B、Gemma 4、Mistral Large 3、Phi-4、Yi均允许无限制商用。Llama 4保留7亿月活条款,Qwen3.8-2.4T-A95B设定营收分级授权,Cohere Command R+限研究用途,腾讯混元与Stability LM为定制许可。

决策框架建议:先按许可证筛选,再按硬件预算分级(16GB消费卡跑Phi-4 14B等,32GB单卡跑Qwen3.8-27B/Gemma 4 31B,48GB以上跑70B稠密,8卡H100/H200跑前沿MoE),再按主任务选型(编码首选DeepSeek V4 Pro/Flash,科学推理选Qwen 3.5,长文档RAG选Llama 4 Scout 1000万上下文,工具调用选Qwen 3.5/Mistral Large 3/Llama 4 Maverick,边缘部署选Phi-4 14B/Gemma 4小模型)。延迟敏感场景优先小激活参数MoE。

架构趋势:MoE成百亿级旗舰默认,稠密模型在320亿以下仍具优势;长上下文技术成熟(DeepSeek CSA/HCA、Llama 4交织注意力),但尾部召回仍是痛点;推理专用模型成独立品类;混合注意力与状态空间模型在长尾显现;量化随模型同步发布,生产可直接用Q4。

硬件分级:边缘/笔记本8-16GB跑14B级;强力工作站24-32GB跑270亿-310亿稠密或30亿激活MoE;专业工作站48-96GB跑70B稠密或千亿MoE量化;单服务器80GB H100跑V4 Flash全精度激活;前沿集群8卡H200/B300跑V4 Pro、Llama 4 Maverick、Qwen 3.5-397B生产速度。Q4_K_M量化显存降75%,质量损失微。

过度炒作:千万上下文实战召回不稳、总参数营销数字、推理专用模型用于通用聊天、Falcon H1R仅凭数学基准宣称“最强7B”。被低估:Gemma 4 31B单卡部署最实用、DeepSeek V4 Flash性价比碾压同级、Qwen 3.6-35B-A3B在带宽受限硬件上极快、Yi-Coder 9B小而强、Mistral Large 3为欧盟合规首选。

常见问答:DeepSeek V4属MIT开源;Llama 4初创可用但需标注;生产代码审查最廉价选Qwen 3.6-35B-A3B或Gemma 4 31B;微调针对领域语言与工具模式,不提升原始推理;多模态模型仅在需视觉时启用;自托管中资模型无遥测风险;评估新模型需跑真实提示、抗污染基准、实时延迟成本;SWE-bench Verified为500人工验证子集;托管适合突发流量,自建适合日均超千万Token稳态;开源智能体框架(vLLM、SGLang、LangGraph)同等重要;旗舰开放模型约每4-6周迭代,评估管线须支持一日切换;2026主流为混合策略:高频内部用开放权重,高风险对外用闭源API。

跟踪来源:ArtificialAnalysis、LiveCodeBench、Hugging Face Open LLM Leaderboard v2、LMSYS Arena四大看板为核心信号。最快落地路径是引入已在生产部署过开放权重模型的工程师,涵盖微调、服务、延迟成本权衡、在线推理集群、微调管线等实战经验。

综合自网络信息


吉ICP备2020006555号

ai987.cn

⌜ 免 责 声 明 ⌝
本站仅为个人学习AI(人工智能)知识的相关日志,网页内容(如有图片或视频亦包括在内)短期缓存均无商业目的。
遇有侵害您合法权益之处欲申诉删改,可联络处理(删/改)!