今天凌晨,AI 圈炸了
一边是梁文锋,放出了 DeepSeek V4 Pro 正式版。另一边是马斯克,砸下了 Grok 4.6。两大巨头,同一时间发布,火药味瞬间拉满。
更魔幻的是——这两款模型,都在性能上追平甚至超越了 OpenAI 和 Anthropic 的旗舰产品,而价格却只有它们的几十分之一。
跑分成绩单:谁更强?
DeepSeek V4 Pro 在三项 Agent 测试中拿下第一:
- 网络安全智能体 CyberGym:83.3 分,超过 Claude Fable 5 的 83.1 分
- 自动化任务 AutomationBench:31.8 分,碾压 Fable 5 的 29.1 分
- 终端任务 Terminal-Bench:87.9 分,距离 Fable 5 只差 0.1 分
Grok 4.6 则在知识工作测试中全面反杀:
- 综合智能指数:61 分,追平 GPT-5.6 Sol
- 编码测试 CursorBench:69.9%,超过 GPT-5.6 的 67.2%
- 知识工作 GDPval-AA:1753 Elo,超过 Fable 5 和 GPT-5.6
价格才是真正的杀手锏
每百万输出 Token 的价格对比:
- DeepSeek V4 Pro:0.87 美元
- Grok 4.6:6 美元
- GPT-5.6 Sol:30 美元
- Claude Opus 5:25 美元
- Claude Fable 5:50 美元
算下来,DeepSeek 的价格是 Grok 的 1/7,是 GPT-5.6 的 1/35,是 Fable 5 的 1/57。顶尖智能,终于不再高不可攀。
实测对比:手搓游戏谁更强?
开发者用相同的提示词,让两款模型分别从零开发一款 Flappy Bird 游戏。
DeepSeek V4 Pro:消耗超过 2 万 Token,成本仅 0.019 美元。游戏中有山脉远景、层叠云朵,水管带有渐变与体积感,角色穿过水管时会弹出「+1」浮动动画。细节几乎全部拉满。
Grok 4.6:只用了约 5000 Token,成本 0.03 美元。游戏也能玩,但场景层次和细节明显不如 DeepSeek。
不过在 60 种 Bento 设计风格生成任务中,Grok 4.6 扳回一城,排版和视觉层次更成熟。
怎么用?
DeepSeek V4 Pro:已接入 CodeBuddy、Cursor、API 等渠道。官方预告近期将调价,建议趁现在价格窗口抓紧用。
Grok 4.6:通过 Cursor、Grok Build、API 及 OpenRouter、Vercel、Cloudflare 等渠道可用。首周在 Grok Build 和 Cursor 中还有 2 倍用量优惠。
写在最后
过去,开发者往往只能在「用不起」和「不够强」之间艰难选择。而今天,DeepSeek 用仅为 SOTA 几十分之一的价格掀翻桌子,Grok 也以极高的性价比紧随其后。
这场「高能低价」的正面冲击,已经撕开了旧秩序的裂口。马斯克已经预告 Grok 4.7 马上就来,战争才刚刚开始。
评论区