开放前沿模型,一个 API。
基准评测
独立第三方智能与成本对比——开放前沿模型对阵闭源前沿。
智能指数
AA 智能指数 v4.1.1 · 越高越好Kimi K3
59.7
DeepSeek V4 Pro
53.0
DeepSeek V4 Flash
51.8
Claude Opus 5
63.1
Claude Fable 5
62.1
GPT-5.6 Sol
60.9
单任务成本
智能指数单任务加权成本(美元) · 越低越好DeepSeek V4 Flash
$0.027
DeepSeek V4 Pro
$0.056
Kimi K3
$0.84
GPT-5.6 Sol
$1.23
Claude Opus 5
$2.34
Claude Fable 5
$3.14
智能体工具调用
τ³-Banking · 越高越好Kimi K3
46%
DeepSeek V4 Pro
40%
DeepSeek V4 Flash
39%
GPT-5.6 Sol
44%
Claude Opus 5
42%
Claude Fable 5
38%
编码
Terminal-Bench v2.1 · 越高越好Kimi K3
85%
DeepSeek V4 Pro
79%
DeepSeek V4 Flash
79%
GPT-5.6 Sol
88%
Claude Opus 5
89%
Claude Fable 5
85%
长上下文推理
AA-LCR · 越高越好Kimi K3
83%
DeepSeek V4 Pro
75%
DeepSeek V4 Flash
74%
GPT-5.6 Sol
78%
Claude Opus 5
76%
Claude Fable 5
77%
数据来源:Artificial Analysis(独立第三方评测),截至 2026-08-09。
可用模型
当前均为生产可用版本,新的前沿模型发布后将持续接入。
| 模型 | 上下文 | 能力 | 延迟(TTFT) | 输出速度 | 成功率 |
|---|---|---|---|---|---|
| Kimi K3 | 1M | 工具 推理 结构化输出 视觉 | 3.0 s | 38 tok/s | 100.0% |
| DeepSeek V4 Pro 0813 | 1M | 工具 推理 结构化输出 | 0.5 s | 110 tok/s | 100.0% |
| DeepSeek V4 Flash 0731 | 1M | 工具 推理 结构化输出 | 0.5 s | 115 tok/s | 100.0% |
点击任意行查看能力规格与快速开始。延迟、输出速度与成功率为在 Corion API 上实测 402 次流式补全的中位数(截至 2026-09-19),反映客户实际获得的路由表现。延迟为首个 token 到达时间,包含模型的推理阶段。
该如何选择?
- •Kimi K3 — 智能水平最高的选择:深度推理、智能体工作流、长周期编码与长文档处理。 典型场景:自主智能体与多步工具调用、代码库级重构、面向大规模文档集的研究与分析,以及准确性优先于延迟的知识工作。
- •DeepSeek V4 Pro 0813 — 高性价比之选:以约 K3 十五分之一的单任务成本提供接近前沿的推理能力,同样具备 1M 上下文,最大输出 375K。 典型场景:在前沿模型价目表下开销过高的推理密集型分析与长周期智能体、代码库级审查、多步自动化与大规模信息综合。仅支持文本——需要图像输入请使用 Kimi K3。
- •DeepSeek V4 Flash — 成本与延迟优化的选择,同样具备 1M 上下文。 典型场景:高并发聊天与客服机器人、分类与信息抽取流水线、批量摘要、实时助手,以及一切单位成本主导的工作负载。
