信息杂货铺24H 营业
GENERAL STORE · V1
MODULE 06LLM BENCHMARK OBSERVATORY · 大模型实测天梯

大模型实测天梯榜

汇集前沿与主流旗舰真实基准:LMSYS 人类盲测 Elo、SWE-bench 真实代码修复率、AIME 数学奥赛与官方价格横评。

Arena 榜首
GPT-6 Astra
1486.2 Elo
长程代码 SOTA
Claude Fable 5
77.8% SWE
满血推理旗舰
Claude Opus 4.6
75.4% 修复率
实测基准口径:• LMSYS Arena (盲测 Elo)• SWE-bench Verified (真实代码修复)• AIME 2024 (数学奥赛)• GPQA Diamond (专家科学)
🎯场景选型预设 (SCENARIO PRESETS):
家族:
GPTS+ 顶尖旗舰综合 99.4
OpenAI

GPT-6.1 Astra

深度思考推理• 上下文 2M
Arena 总分
1545
代码 1568
SWE-bench
82.5%
代码修复率
官方价格
$10.00
出 $50.00
2M 原生窗口与突破性全自主工程 Agent 巅峰
ClaudeS+ 顶尖旗舰综合 99.4
Anthropic

Claude Opus 5.5 (Thinking)

混合思考推理• 上下文 1M
Arena 总分
1502
代码 1530
SWE-bench
82.4%
代码修复率
官方价格
$4.00
出 $20.00
SWE-bench Pro 89.9 的自适应思考旗舰,还便宜了 20%
KimiS+ 顶尖旗舰综合 99.4
月之暗面

Kimi K3 (2.8T 开源推理与智能体旗舰)

超长上下文旗舰• 上下文 1M (1024K)
Arena 总分
1520
代码 1545
SWE-bench
81.6%
代码修复率
官方价格
$2.00
出 $8.00
2.8T MoE 架构与 SWE-bench 81.6% 的全自主工程代码超级旗舰
GeminiS+ 顶尖旗舰综合 99.4
Google

Google Gemini 4 Argon

超长上下文旗舰• 上下文 4M (4096K)
Arena 总分
1532
代码 1548
SWE-bench
80.2%
代码修复率
官方价格
$2.00
出 $8.00
全新 Argon 架构 · 原生 400 万超大窗口与全模态天花板
GPTS+ 顶尖旗舰综合 99.4
OpenAI

GPT-6 Astra

深度思考推理• 上下文 1M
Arena 总分
1528
代码 1552
SWE-bench
79.6%
代码修复率
官方价格
$10.00
出 $50.00
大模型算力与全自主工程调度的绝对天花板
GPTS+ 顶尖旗舰综合 99.4
OpenAI

GPT-6.1 Sol (Reasoning)

深度思考推理• 上下文 1M
Arena 总分
1526
代码 1548
SWE-bench
78.4%
代码修复率
官方价格
$2.00
出 $10.00
把顶级 Agent 编程攻坚力稳定在 $2/$10 工业甜点位
GPTS+ 顶尖旗舰综合 98.8
OpenAI

GPT-6 Sol (Reasoning)

深度思考推理• 上下文 1M
Arena 总分
1512
代码 1536
SWE-bench
74.6%
代码修复率
官方价格
$2.00
出 $10.00
把前沿级 Agent 能力压到 $2/$10 的主力档
ClaudeS+ 顶尖旗舰综合 98.6
Anthropic

Claude Fable 5 (Thinking)

深度思考推理• 上下文 500K
Arena 总分
1478.4
代码 1508.6
SWE-bench
77.8%
代码修复率
官方价格
$5.00
出 $25.00
长程 Agentic Coding 与全栈自治编程划时代标杆
DeepSeekS+ 顶尖旗舰综合 98.6
DeepSeek

DeepSeek-V4.1 (全血 MoE 旗舰)

混合思考推理• 上下文 512K
Arena 总分
1496
代码 1528
SWE-bench
74.5%
代码修复率
官方价格
$0.45
出 $1.80
以 1/5 极低成本正面对决海外一线顶尖旗舰的工业奇迹
GeminiS+ 顶尖旗舰综合 98.2
Google

Google Gemini 3.0 Pro

超长上下文旗舰• 上下文 2M (2048K)
Arena 总分
1480
代码 1502.4
SWE-bench
75.8%
代码修复率
官方价格
$2.00
出 $8.00
200万超大上下文与原生全模态断层领先
ClaudeS+ 顶尖旗舰综合 97.7
Anthropic

Claude Opus 4.6 (Thinking)

深度思考推理• 上下文 200K
Arena 总分
1471.2
代码 1495.8
SWE-bench
75.4%
代码修复率
官方价格
$15.00
出 $75.00
学术严谨性与超大代码库缜密推演的满血王座
GLMS+ 顶尖旗舰综合 97.6
智谱AI

智谱 GLM-5.3 (代码/推理旗舰)

混合思考推理• 上下文 1M
Arena 总分
1485
代码 1512
SWE-bench
72.8%
代码修复率
官方价格
$1.80
出 $7.20
1M 原生超长上下文与深层 Agent 自动化重构巅峰
GPTS+ 顶尖旗舰综合 97.5
OpenAI

GPT-5.6 Sol (Reasoning)

深度思考推理• 上下文 200K
Arena 总分
1462.5
代码 1490.8
SWE-bench
73.2%
代码修复率
官方价格
$2.50
出 $10.00
重算力竞赛基准标杆,工业高难数理严密论证首选
QwenS+ 顶尖旗舰综合 97.2
阿里云通义

Qwen 3 Max

通用旗舰多模态• 上下文 1M
Arena 总分
1482
代码 1505
SWE-bench
70.8%
代码修复率
官方价格
$1.60
出 $6.40
1M 超长全模态解析力与阿里云企业级 SLA 行业标杆
KimiS 头部第一梯队综合 95.3
月之暗面

Kimi K2 (长程思考推理旗舰)

超长上下文旗舰• 上下文 2M (2048K)
Arena 总分
1466
代码 1475
SWE-bench
65.2%
代码修复率
官方价格
$1.50
出 $6.00
200万原生上下文融合自适应长思考的学术研报挖掘之王
ClaudeS+ 顶尖旗舰综合 92.9
Anthropic

Claude 3.7 Sonnet (Thinking)

混合思考推理• 上下文 200K
Arena 总分
1300.6
代码 1339.2
SWE-bench
70.3%
代码修复率
官方价格
$3.00
出 $15.00
首创双模无缝融合、综合开发效能最高的一线主力
GLMS 头部第一梯队综合 92.9
智谱AI

智谱 GLM-5.2 (推理旗舰)

深度思考推理• 上下文 256K
Arena 总分
1438
代码 1458.2
SWE-bench
57.2%
代码修复率
官方价格
$1.50
出 $6.00
深层中文逻辑与政企复杂场景的国产排头兵
GPTS 头部第一梯队综合 91.8
OpenAI

GPT-5.6 Terra (Balanced)

通用旗舰多模态• 上下文 200K
Arena 总分
1412
代码 1438.5
SWE-bench
58.6%
代码修复率
官方价格
$1.00
出 $4.00
速度、智商与价格的最佳平衡点,高频业务黄金中枢
GPTS+ 顶尖旗舰综合 91.8
OpenAI

OpenAI o3-mini (High)

深度思考推理• 上下文 200K
Arena 总分
1420.7
代码 1437.9
SWE-bench
49.3%
代码修复率
官方价格
$1.10
出 $4.40
数理逻辑极其强悍的高性价比推理利器
GeminiS+ 顶尖旗舰综合 91.7
Google

Google Gemini 2.5 Pro

超长上下文旗舰• 上下文 2000K
Arena 总分
1466.2
代码 1469.9
SWE-bench
51.5%
代码修复率
官方价格
$1.25
出 $5.00
长文本与高智能综合平衡的典范
GPTA+ 高性价比主力综合 90.6
OpenAI

GPT-6 Luna (Flash/Fast)

性价比轻量• 上下文 1M
Arena 总分
1406
代码 1426
SWE-bench
57.4%
代码修复率
官方价格
$0.10
出 $0.50
50% 降价换取的 1M 上下文高并发底座
DeepSeekS+ 顶尖旗舰综合 90.5
DeepSeek

DeepSeek-R1 (671B)

深度思考推理• 上下文 128K
Arena 总分
1424.4
代码 1436.4
SWE-bench
49.2%
代码修复率
官方价格
$0.55
出 $2.19
逻辑推理逼近顶尖闭源,性价比无可挑剔的国产骄傲
GrokS+ 顶尖旗舰综合 90.5
xAI

xAI Grok 3

深度思考推理• 上下文 128K
Arena 总分
1423.1
代码 1440.7
SWE-bench
48.5%
代码修复率
官方价格
$3.00
出 $15.00
竞技场高分、数理表现强悍且言论犀利的黑马
GLMA+ 高性价比主力综合 89.7
智谱AI

智谱 GLM-5.3-Air (高性价比极速档)

性价比轻量• 上下文 256K
Arena 总分
1398
代码 1415
SWE-bench
54.2%
代码修复率
官方价格
$0.15
出 $0.60
单价 $0.15 换取的高吞吐轻量思考与极速响应底座
GPTS+ 顶尖旗舰综合 89.3
OpenAI

OpenAI o1 (Full)

深度思考推理• 上下文 200K
Arena 总分
1365.9
代码 1377.5
SWE-bench
48.9%
代码修复率
官方价格
$15.00
出 $60.00
初代慢思考系统级标杆,具备深厚数理验证沉淀
QwenS+ 顶尖旗舰综合 89.2
阿里云通义

Qwen 2.5 Max

通用旗舰多模态• 上下文 128K
Arena 总分
1429
代码 1460.4
SWE-bench
43.5%
代码修复率
官方价格
$2.80
出 $8.40
LMSYS 竞技榜名列前茅,中文全模态与指令遵循顶级
DeepSeekA+ 高性价比主力综合 87.8
DeepSeek

DeepSeek-V4.1-Flash (极速高并发屠夫)

性价比轻量• 上下文 256K
Arena 总分
1386
代码 1408
SWE-bench
49.5%
代码修复率
官方价格
$0.06
出 $0.24
单价 $0.06 的百亿 Token 工业数据流水线降本神器
GeminiS 头部第一梯队综合 87.2
Google

Google Gemini 2.5 Flash

性价比轻量• 上下文 1000K
Arena 总分
1408.9
代码 1420
SWE-bench
42.1%
代码修复率
官方价格
$0.10
出 $0.40
百万上下文秒级吞吐的流水线骨干
DeepSeekS 头部第一梯队综合 84.7
DeepSeek

DeepSeek-V3 / V3.1

通用旗舰多模态• 上下文 128K
Arena 总分
1417.7
代码 1436.4
SWE-bench
42%
代码修复率
官方价格
$0.14
出 $0.28
$0.14/1M 极低单价下无敌手的全能主力
GeminiA+ 高性价比主力综合 83.6
Google

Google Gemini 2.0 Flash

混合思考推理• 上下文 1000K
Arena 总分
1358.2
代码 1365.1
SWE-bench
38%
代码修复率
官方价格
$0.10
出 $0.40
毫秒级响应与超低价格的多模态小钢炮
GPTA+ 高性价比主力综合 83.5
OpenAI

GPT-5.6 Luna (Flash/Fast)

性价比轻量• 上下文 128K
Arena 总分
1338
代码 1355.2
SWE-bench
42.5%
代码修复率
官方价格
$0.15
出 $0.60
首字延迟 < 200ms 的高并发秒级响应先锋
ClaudeS 头部第一梯队综合 83
Anthropic

Claude 3 Opus (20240229)

通用旗舰多模态• 上下文 200K
Arena 总分
1355.4
代码 1362.8
SWE-bench
38%
代码修复率
官方价格
$15.00
出 $75.00
经典文学文采、学术论述与微妙隐喻的永恒标杆
GLMS 头部第一梯队综合 83
智谱AI

智谱 GLM-4.5 / GLM-4-Plus

通用旗舰多模态• 上下文 128K
Arena 总分
1429.1
代码 1446.9
SWE-bench
33.8%
代码修复率
官方价格
$7.00
出 $7.00
成熟稳定的国产政企级通用主力
ClaudeS 头部第一梯队综合 81.4
Anthropic

Claude 3.5 Sonnet (1022)

通用旗舰多模态• 上下文 200K
Arena 总分
1299.7
代码 1339.5
SWE-bench
50.8%
代码修复率
官方价格
$3.00
出 $15.00
前端 UI 审美业界公认第一,无思考等待延迟
GPTS 头部第一梯队综合 81.4
OpenAI

GPT-4.5 Preview

通用旗舰多模态• 上下文 128K
Arena 总分
1415.6
代码 1419.1
SWE-bench
39.5%
代码修复率
官方价格
$75.00
出 $150.00
知识面极其宽广的世界模型研究版
GPTS 头部第一梯队综合 79.6
OpenAI

GPT-4o (2024-11-20)

通用旗舰多模态• 上下文 128K
Arena 总分
1429.4
代码 1434.7
SWE-bench
38.8%
代码修复率
官方价格
$2.50
出 $10.00
生态整合度最完备的通用多模态奠基者
GLMA+ 高性价比主力综合 78.7
智谱AI

智谱 GLM-4.5-Air

性价比轻量• 上下文 128K
Arena 总分
1389.9
代码 1414
SWE-bench
26.8%
代码修复率
官方价格
$0.14
出 $0.14
响应敏捷、高并发经济实惠的国产对话底座
QwenA+ 高性价比主力综合 77.8
阿里云通义

Qwen 2.5 Coder 32B

代码专用• 上下文 128K
Arena 总分
1235.1
代码 1278.3
SWE-bench
35.8%
代码修复率
官方价格
$0.28
出 $0.84
单卡可跑、开源私有部署的最强代码模型
ClaudeA+ 高性价比主力综合 75.3
Anthropic

Claude 3.5 Haiku

性价比轻量• 上下文 200K
Arena 总分
1256.4
代码 1287.2
SWE-bench
40.6%
代码修复率
官方价格
$0.80
出 $4.00
轻量级模型中指令遵循与格式化输出最稳定者
GPTA+ 高性价比主力综合 72.2
OpenAI

GPT-4o mini

性价比轻量• 上下文 128K
Arena 总分
1289.2
代码 1299.9
SWE-bench
23.4%
代码修复率
官方价格
$0.15
出 $0.60
通用极低价模型先驱,轻量分类过滤守门人
GLMA 轻量走量综合 70.1
智谱AI

智谱 GLM-4-Flash

性价比轻量• 上下文 128K
Arena 总分
1240.5
代码 1245
SWE-bench
18.5%
代码修复率
官方价格
$0.00
出 $0.00
官方永久免费开放的良心入门基座