导航菜单
首页 OPC项目 北京OPC OPC完全指南 AI资讯 AI应用市场 OPC市场 OPC导航 工具推荐 关于

# 全球大模型7月激战:Grok 4、Kimi K2、Qwen3-Coder谁主沉浮

> 摘要:2025年7月,全球AI领域上演近40次重大更新,堪称"神仙打架"。xAI发布Grok 4,以AIME满分、HLE 44.4%的成绩登顶"最聪明模型",但其多智能体协同的高昂成本与伦理翻车引发争议;月之暗面祭出万亿参数开源模型Kimi K2,在模型即Agent的道路上另辟蹊径;阿里巴巴一周三连发,Qwen3-Coder超越GPT-4.1和Claude4,中国开源速度令世界侧目。本文深度拆解三大焦点模型的实力与短板,探讨大模型竞赛的未来走向。


一、7月全球AI圈:"神仙打架",近40次更新狂飙突进

刚刚过去的7月,全球AI领域用"狂飙"来形容毫不为过。

据不完全统计,全球至少有近20家知名AI公司进行了更新,涉及至少40款模型及产品。月初,Meta砸下上亿美元奖金从OpenAI、Google、Apple高价挖人;中旬,OpenAI和Google纷纷放出模型上新大招;月底,中国大模型公司密集发力——仅在最后一周,阿里、字节、智谱、阶跃全部上新模型,整个HuggingFace几乎被中国AI占领。

这场激战呈现出两个显著特点:国内卷开源,海外卷用户和赚钱。大语言、多模态、推理、编程——模型层全线更新,Coding走向全栈,Agent仍在深度研究方向上卷工程能力。三大焦点事件尤其引人注目:Grok 4的"碾压性"数据、Kimi K2的万亿参数开源、阿里Qwen3的一周三连发。

二、Grok 4:最强模型为何翻车?

7月10日,马斯克旗下xAI发布Grok 4,马斯克称其为"史上最聪明的模型",在多个学术领域达到甚至超过博士水准。

从评测数据看,Grok 4确实堪称"碾压级"表现:在代表数学能力的AIME上斩获满分;在史上最难的评测集HLE(Humanity's Last Exam,由全球近千名科学家共同打造的3000道高难度题目)上,顶配版SuperGrok Heavy得分高达44.4%,几乎是此前OpenAI o3(约22%)的两倍。在GPQA、LiveCodeBench、USAMO等常规榜单中,Grok 4同样呈碾压态势。

然而,实测翻车也来得很快。有知乎网友用同样编程任务测试GPT-4、Claude4和Grok 4,结果是:GPT-4代码结构清晰、逻辑完整,Claude4代码质量高且有详细注释,而Grok 4虽然基础功能能实现,但代码冗余、优化空间很大——"简单的算法题还能应付,复杂系统设计和代码优化就力不从心了"。此外,Grok 4还因引用X平台用户内容而陷入"反犹言论"等伦理争议,Web框架Flask之父Simon Willison的实验更发现,64条回复中54条都倾向于马斯克本人的观点。

Grok 4最核心的创新在于多智能体协同(Multi-Agent Collaboration)。不同于传统模型"先训练后调用工具",Grok 4在训练阶段就将工具调用能力嵌入底层架构,SuperGrok Heavy支持最多四个独立智能体同时处理同一任务,从不同角度分析问题后交叉验证、整合最优解。但这种方式是典型的"富人游戏":坊间传闻Grok 4用了20万张英伟达H100,训练计算量是Grok 2的100倍,普通版月租30美元、Heavy版高达300美元。从猛烈抨击OpenAI"忘记初心"到推出"最贵大模型",马斯克的"AI平权"口号,在这一刻显得格外苍白。

三、Kimi K2:万亿参数开源,模型即Agent的另辟蹊径

7月11日深夜,月之暗面开源Kimi K2——一个万亿参数(1TB)规模的混合专家(MoE)模型,激活参数32B,是目前全球开源大模型中参数规模最大的。在SWE Bench Verified、Tau2、AceBench等基准测试中,Kimi K2均取得开源模型SOTA成绩。

Kimi K2的差异化定位十分清晰:模型即Agent。官方明确强调,该模型针对Agent代理能力做了优化,专为工具使用、推理和自主解决问题而设计。在实际演示中,Kimi K2能将"规划Coldplay巡演行程"这类复杂需求自动拆解为可执行的ToolCall结构,完成机酒规划并直接导入谷歌日历——《IT时报》记者实测对比发现,同样的旅行规划需求,DeepSeek、腾讯元宝和豆包都只给出趋势建议,而Kimi K2能直接给出最低票价方案和比价网站链接。

不过,Kimi K2的隐忧同样明显:算力严重不足。记者仅测试不到10个问题,对话框便提示"当前模型对话次数已达到上限"。这或许正是月之暗面选择开源的原因——既然无法在C端算力上与xAI、字节等大厂正面竞争,不如做一个"好用"的开源基座模型,借助社区力量完善技术生态,倒逼自身以更高技术标准迭代。这条"开源换生态"的路线,在DeepSeek已经验证过的中国AI赛道上,或许是一条更务实的生存之道。

四、阿里Qwen3三连发:中国开源速度震撼全球

7月22日至28日,阿里巴巴在短短一周内"日更"式开源四个模型:Qwen3基础模型(非思考版)、Qwen3推理模型、AI编程模型Qwen3-Coder,以及视频生成模型通义万相2.2,密集程度令业界震撼。

三大模型的竞争力各有锋芒:Qwen3基础模型在多项关键指标中击败GPT-4o和Claude4,长文本能力提升至256K,相当于将几十万字的小说扔给模型,它能快速读完并理解;Qwen3推理模型性能比肩顶级闭源模型Gemini 2.5 Pro和o4-mini;而最具话题性的是Qwen3-Coder——这是千问系列首个采用MoE架构的编程模型,480B参数,支持1M Token上下文,代码能力和Agent能力超越GPT-4.1和Claude4,成为全球顶级编程模型之一。

Qwen3-Coder的发布立刻引发连锁反应:阿里股价应声上涨,两周内AI叙事推动股价累计上涨20%;苹果研究员公开称赞Qwen正在推动开源人工智能研究。更有网友惊呼:"刚入行的程序员一天就能完成资深程序员一周的工作,生成一个品牌官网最快只需5分钟。"当宇树科技创始人王兴兴分享"现在很多代码都偷懒不写了,交给大模型来写,成功率可达90%以上"时,AI编程的生产力革命已不再是远景,而是正在发生的现实。

从产业层面看,阿里的策略并非单点突破,而是一张从基础模型、推理模型、编程模型到视频模型的全栈AI布局图。配合"AI+云"协同发展逻辑,开源模型正在从"能否形成价值闭环"的质疑中走出,成为驱动云收入增长的核心引擎。

五、结语:模型竞赛走向何方?

7月的这场"神仙打架",折射出大模型竞赛的三个关键趋势。

第一,"大力出奇迹"仍是底层逻辑,但代价越来越高昂。Grok 4用20万张H100堆出最强性能,月租300美元让人望而却步;Kimi K2虽有万亿参数却受困于算力不足。Scaling Law的红利仍在,但成本正在成为模型走向普及的核心瓶颈。

第二,开源正在重构全球AI竞争格局。中国企业的"开源换生态"路线——从DeepSeek到阿里三连发再到Kimi K2——正在与美国主导的闭源生态形成对垒。甚至连特朗普政府的AI行动计划也开始强调开源模型的战略价值,提出打造"美国版DeepSeek"。当开源成为地缘政治博弈的棋子,技术普惠与商业利益的平衡将更加复杂。

第三,Agent化是共同方向,但路径分野明显。Grok 4将多智能体内化于训练阶段,走"富人路线";Kimi K2选择模型即Agent,走"普惠路线";Qwen3-Coder则在编程Agent场景中深耕垂直能力。谁能在性能与成本之间找到最优解,谁就将定义下一代AI应用范式。

7月的硝烟尚未散尽,OpenAI的GPT-5传闻已若隐若现。可以确定的是,这场竞赛远未到终局——它才刚刚进入最精彩的章节。


*本文仅代表作者个人观点(仅供参考)*

来源:创客OPC原创整理

上一篇
DPA4大原子模型登顶全球第一:四年四次迭代,中国科学计算的...
下一篇
从Transformer到RL:大模型训练范式正在被重写...