AI Benchmarks

เทียบโมเดล AI ด้วย Benchmark จริงAI model benchmarks

คะแนนความฉลาด การเขียนโค้ด การทำงานแบบ agent การค้นเว็บ และงานออกแบบ รวมจาก Artificial Analysis, Design Arena และการทดสอบของ OpenRouter — อัปเดตทุกคืนIntelligence, coding, agentic, web-search and design scores from Artificial Analysis, Design Arena and OpenRouter evals — refreshed nightly.

ข้อมูลล่าสุดLast updated 9 Oct 2026

ดัชนีความฉลาด (Intelligence Index)Intelligence Index

คะแนนรวมจากชุดทดสอบความรู้ การใช้เหตุผล และคณิตศาสตร์ ยิ่งสูงยิ่งเก่ง · ราคาเป็น $ ต่อ 1 ล้าน token (input / output)Composite of knowledge, reasoning and maths evals — higher is better · price in $ per 1M tokens (input / output)

  1. 1 Claude Opus 5.5 (Max, Default Fallback) $4.4 / $22 57.6
  2. 2 Claude Sonnet 5.5 (Max, Default Fallback) $2 / $10 56
  3. 3 Claude Fable 5.1 (Max, Default Fallback) $5 / $25 · coding 81.6 · agentic 57.9 53.4
  4. 4 Qwen3.8 Max · coding 68.9 · agentic 49.9 53.4
  5. 5 GPT-6 Astra (Max) $60 / $300 · coding 76.9 · agentic 51 52.7
  6. 6 GPT-6.1 Sol (Max) $2.2 / $11 51.8
  7. 7 Claude Opus 5 (Max) $5.5 / $27.5 · coding 78 · agentic 56.5 50.8
  8. 8 Claude Fable 5 (Max, Opus 4.8 Fallback) $10 / $50 · coding 76.5 · agentic 50.7 49.6
  9. 9 Muse Spark 1.3 (Max) $1.25 / $4.25 · coding 75.8 · agentic 55.5 48.1
  10. 10 GPT-6 Sol (Max) $2 / $10 47.6
  11. 11 GPT-5.6 Sol (Max) $4 / $20 · coding 77.4 · agentic 50.2 47
  12. 12 Grok 4.7 (Xhigh) $2.2 / $6.6 46.4
  13. 13 MiMo-V2.6-Pro $0.44 / $0.87 46.3
  14. 14 Qwen3.8 Max (0902) $2 / $6 · coding 76.2 · agentic 56 45.4
  15. 15 GLM-5.3 (Max) $2.1 / $6.6 · coding 74.8 · agentic 53.1 44.8
  16. 16 Grok 4.6 (High) $2.2 / $6.6 · coding 76.8 · agentic 53 44.3
  17. 17 Kimi K3 (Max) $2.99 / $15 · coding 76.2 · agentic 50 43.6
  18. 18 Claude Haiku 5.5 (Max) $0.11 / $0.55 43.4
  19. 19 GPT-5.6 Terra (Max) $4 / $24 · coding 76.7 · agentic 43.2 42.1
  20. 20 Claude Opus 4.8 (Max) $10 / $50 · coding 74.3 · agentic 41.9 41.8
  21. 21 GLM 5.3 Flash $0.19 / $0.63 · coding 71.5 · agentic 50.9 41.8
  22. 22 Ling 3.1 Flash $0 / $0 41.1
  23. 23 Gemini 3.8 Flash (High) $1.35 / $6.75 · coding 76.3 · agentic 40.2 40.9
  24. 24 Claude Opus 4.7 (Max) $5 / $25 · coding 73.6 · agentic 38.6 40.7
  25. 25 Qwen3.8 2.4T A95B $2 / $6 · coding 71.9 · agentic 50.1 39.9

Source: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings). · as of 8 Oct 2026

ดัชนีการเขียนโค้ด (Coding Index)Coding Index

คะแนนจากชุดทดสอบการเขียนและแก้โค้ดScores from code-writing and code-editing evals

  1. 1 Claude Fable 5.1 (Max, Default Fallback) $5 / $25 per 1M 81.6
  2. 2 Claude Opus 5 (Max) $5.5 / $27.5 per 1M 78
  3. 3 GPT-5.6 Sol (Max) $4 / $20 per 1M 77.4
  4. 4 GPT-6 Astra (Max) $60 / $300 per 1M 76.9
  5. 5 Grok 4.6 (High) $2.2 / $6.6 per 1M 76.8
  6. 6 GPT-5.6 Terra (Max) $4 / $24 per 1M 76.7
  7. 7 Claude Fable 5 (Max, Opus 4.8 Fallback) $10 / $50 per 1M 76.5
  8. 8 Gemini 3.8 Flash (High) $1.35 / $6.75 per 1M 76.3
  9. 9 Qwen3.8 Max (0902) $2 / $6 per 1M 76.2
  10. 10 Kimi K3 (Max) $2.99 / $15 per 1M 76.2
  11. 11 Muse Spark 1.3 (Max) $1.25 / $4.25 per 1M 75.8
  12. 12 GPT-5.5 (Xhigh) $2.5 / $15 per 1M 74.9
  13. 13 GLM-5.3 (Max) $2.1 / $6.6 per 1M 74.8
  14. 14 Claude Opus 4.8 (Max) $10 / $50 per 1M 74.3
  15. 15 Claude Opus 4.7 (Max) $5 / $25 per 1M 73.6
  16. 16 Grok 4.5 (High) $4 / $12 per 1M 72.4
  17. 17 Muse Spark 1.2 (Xhigh) $1.25 / $4.25 per 1M 72.2
  18. 18 Qwen3.8 2.4T A95B $2 / $6 per 1M 71.9
  19. 19 GLM 5.3 Flash $0.19 / $0.63 per 1M 71.5
  20. 20 Gemini 3.7 Flash (Medium) $1.35 / $6.75 per 1M 71.5
  21. 21 Claude Sonnet 5 (Max) $2.2 / $11 per 1M 71.5
  22. 22 GPT-5.6 Luna (Max) $0.4 / $2.4 per 1M 71.4
  23. 23 Muse Spark 1.1 (Xhigh) $1.25 / $4.25 per 1M 71.3
  24. 24 GPT-5.4 (Xhigh) $5 / $30 per 1M 71.1
  25. 25 Gemini 3.6 Flash (High) $1.35 / $6.75 per 1M 69.2

Source: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings).

τ²-Bench Airline

AI ทำหน้าที่พนักงานสายการบิน คุยหลายรอบ เรียก tool และต้องทำตามนโยบายเคร่งครัด · % งานที่ทำสำเร็จMulti-turn customer-service agents calling tools under strict policy · % of tasks solved

  1. 1 Anthropic: Claude Fable 5 $0.927 / task · 450 tasks 79.9%
  2. 2 Xiaomi: MiMo-V2.6-Flash $0.020 / task · 50 tasks 79.3%
  3. 3 Anthropic: Claude Fable 5.1 $0.716 / task · 200 tasks 79.2%
  4. 4 Anthropic: Claude Opus 5 $0.487 / task · 450 tasks 78.6%
  5. 5 Google: Gemini 3.7 Flash $0.115 / task · 96 tasks 78.5%
  6. 6 Amazon: Nova Micro 1.0 $1.28 / task · 150 tasks 78%
  7. 7 StepFun: Step 3.7 Flash $0.020 / task · 50 tasks 77.3%
  8. 8 Anthropic: Claude Opus 4.5 $0.532 / task · 450 tasks 77.1%
  9. 9 OpenAI: GPT-5.1 $0.415 / task · 150 tasks 77.1%
  10. 10 Qwen: Qwen3.8 27B $0.081 / task · 300 tasks 77%
  11. 11 Z.ai: GLM 5 $0.045 / task · 450 tasks 77%
  12. 12 DeepSeek: DeepSeek V4 Pro 0813 $0.100 / task · 350 tasks 77%
  13. 13 Qwen: Qwen3.5 397B A17B $0.170 / task · 400 tasks 76.9%
  14. 14 Google: Gemini 3.5 Flash Lite $0.098 / task · 150 tasks 76.9%
  15. 15 Google: Gemma 4 31B $0.028 / task · 446 tasks 76.7%
  16. 16 Anthropic: Claude Opus 4.8 $0.498 / task · 450 tasks 76.4%
  17. 17 DeepSeek: DeepSeek V4 Pro 0423 $0.040 / task · 450 tasks 76.4%
  18. 18 DeepSeek: DeepSeek V4.1 Flash $0.032 / task · 150 tasks 76.2%
  19. 19 Z.ai: GLM 5.3 $0.062 / task · 250 tasks 76.1%
  20. 20 Qwen: Qwen3.5-122B-A10B $0.169 / task · 550 tasks 76.1%
  21. 21 GLM 5.3 $0.016 / task · 50 tasks 76%
  22. 22 Anthropic: Claude Opus 4.7 $0.419 / task · 450 tasks 75.9%
  23. 23 Google: Gemini 3.1 Pro Preview $0.359 / task · 150 tasks 75.8%
  24. 24 Z.ai: GLM 5.3 Flash $0.007 / task · 250 tasks 75.6%
  25. 25 Qwen: Qwen3.8 2.4T A95B $0.198 / task · 250 tasks 75.5%

Agentic IndexAgentic Index

คะแนนการทำงานหลายขั้นตอนด้วยตัวเองจาก Artificial AnalysisAutonomous multi-step task score from Artificial Analysis

  1. 1 Claude Fable 5.1 (Max, Default Fallback) 57.9
  2. 2 Claude Opus 5 (Max) 56.5
  3. 3 Qwen3.8 Max (0902) 56
  4. 4 Muse Spark 1.3 (Max) 55.5
  5. 5 GLM-5.3 (Max) 53.1
  6. 6 Grok 4.6 (High) 53
  7. 7 GPT-6 Astra (Max) 51
  8. 8 GLM 5.3 Flash 50.9
  9. 9 Claude Fable 5 (Max, Opus 4.8 Fallback) 50.7
  10. 10 GPT-5.6 Sol (Max) 50.2
  11. 11 Qwen3.8 2.4T A95B 50.1
  12. 12 Kimi K3 (Max) 50
  13. 13 Qwen3.8 Max 49.9
  14. 14 DeepSeek V4 Flash Vision (Max) 47.5
  15. 15 Qwen3.8 27B (Xhigh) 45.8

Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). · Source: Artificial Analysis (artificialanalysis.ai) via OpenRouter (openrouter.ai/rankings).

GPQA Diamond

คำถามวิทยาศาสตร์ระดับบัณฑิตศึกษาที่ค้นหาคำตอบตรง ๆ ไม่ได้ ต้องใช้เหตุผล · % ตอบถูกGraduate-level science questions that resist lookup · % correct

  1. 1 Google: Gemini 3.8 Flash $0.068 / question 95.6%
  2. 2 OpenAI: GPT-6 Astra Pro $0.333 / question 95.5%
  3. 3 Fugu Ultra $1.15 / question 94.6%
  4. 4 Google: Gemini 3.1 Pro Preview $0.202 / question 94.5%
  5. 5 OpenAI: GPT-6 Astra $0.113 / question 94.4%
  6. 6 OpenAI: GPT-6.1 Sol $0.021 / question 94.4%
  7. 7 TypeSafe: Jev Router $0.016 / question 93.9%
  8. 8 OpenAI: GPT-5.6 Sol Pro $0.298 / question 93.9%
  9. 9 Google: Gemini 3.7 Flash $0.029 / question 93.9%
  10. 10 OpenAI: GPT-5.5 $0.309 / question 93.7%
  11. 11 Fugu Ultra V2 $0.503 / question 93.3%
  12. 12 SpaceXAI: Grok 4.6 $0.123 / question 92.8%
  13. 13 Google: Gemini 3.6 Flash $0.060 / question 92.6%
  14. 14 Google: Gemini 3.5 Flash $0.141 / question 92.6%
  15. 15 Pareto $0.034 / question 92.4%
  16. 16 OpenAI: GPT-5.6 Sol $0.060 / question 92.1%
  17. 17 Anthropic: Claude Sonnet 5.5 $0.025 / question 92.1%
  18. 18 OpenAI: GPT-6 Sol $0.025 / question 91.9%
  19. 19 MoonshotAI: Kimi K3 $0.132 / question 91.9%
  20. 20 GLM 5.3 Flash $0.005 / question 90.9%
  21. 21 Qwen: Qwen3.7 Max $0.222 / question 90.9%
  22. 22 NVIDIA: Switchyard $0.016 / question 90.7%
  23. 23 MiniMax: MiniMax M3 $0.035 / question 90.3%
  24. 24 OpenAI: GPT-5.4 $0.147 / question 90.3%
  25. 25 Anthropic: Claude Opus 5.5 $0.054 / question 90.2%

Source: OpenRouter evals (openrouter.ai) via OpenRouter (openrouter.ai/rankings). · as of 8 Oct 2026

BrowseComp

หาข้อมูลที่หายากบนเว็บจริง ต้องค้นหลายขั้นHard-to-find facts on the live web

  1. 1 Claude Opus 5 · parallel $2.36 / task · 141s 89.2%
  2. 2 GPT-5.6-Sol · perplexity $0.500 / task · 116s 82.4%
  3. 3 Deepseek V4 Flash 0731 · perplexity $0.080 / task · 135s 77%
  4. 4 GPT-5.6-Luna · perplexity $0.100 / task · 111s 74%

WideSearch

เติมข้อมูลลงตารางทั้งตารางFill an entire table from the web

  1. 1 GPT-5.6-Sol · perplexity $0.830 / task · 136s 84%
  2. 2 GPT-5.6-Luna · perplexity $0.170 / task · 165s 83.4%
  3. 3 Deepseek V4 Flash 0731 · perplexity $0.100 / task · 119s 77.1%
  4. 4 Claude Opus 5 · parallel $1.36 / task · 218s 67.3%

DeepSearchQA

คำตอบเป็นรายการ ต้องค้นให้ครบList answers, scored for completeness

  1. 1 Claude Opus 5 · parallel $0.790 / task · 144s 88.7%
  2. 2 GPT-5.6-Sol · parallel $0.850 / task · 131s 88.4%
  3. 3 GPT-5.6-Luna · parallel $0.110 / task · 100s 87.5%
  4. 4 Deepseek V4 Flash 0731 · parallel $0.090 / task · 99s 81.7%

Humanity's Last Exam

คำถามระดับผู้เชี่ยวชาญ ตอบโดยค้นเว็บExpert questions answered with live search

  1. 1 GPT-5.6-Sol · parallel $0.710 / task · 85s 71%
  2. 2 Claude Opus 5 · parallel $0.410 / task · 125s 67.3%
  3. 3 Auto Router · auto $0.080 / task · 123s 52.5%

Source: OpenRouter search evals (openrouter.ai/benchmarks) · as of 16 Sept 2026

Design Arena

คนโหวตเทียบผลงานออกแบบจากโมเดลแบบไม่เห็นชื่อ แล้วคิดคะแนน Elo · เลือกหมวดPeople vote on blind side-by-side design outputs, scored as Elo · pick a category

  1. 1 Muse Spark 1.3 (xhigh) win 58.1% · 0 battles 1362
  2. 2 Muse Spark 1.3 Max win 56.1% · 0 battles 1352
  3. 3 Kimi K3 win 59.8% · 0 battles 1341
  4. 4 Claude Opus 5.5 win 57.6% · 0 battles 1340
  5. 5 Claude Sonnet 5.5 win 53.9% · 0 battles 1319
  6. 6 Claude Fable 5.1 win 56.3% · 0 battles 1318
  7. 7 Muse Spark 1.2 win 52% · 0 battles 1318
  8. 8 Claude Opus 5 win 56.2% · 0 battles 1314
  9. 9 MiMo-V2.6-Pro win 50.6% · 0 battles 1313
  10. 10 GPT-6.1 Sol win 54.7% · 0 battles 1312
  11. 11 Gemini 3.7 Flash win 54% · 0 battles 1309
  12. 12 Gemini 3.8 Flash win 50% · 0 battles 1306
  13. 13 GLM-5.3 win 54.9% · 0 battles 1305
  14. 14 Gemini 3.6 Flash win 55.3% · 0 battles 1303
  15. 15 Claude Fable 5 win 56% · 0 battles 1300
  1. 1 Claude Opus 5.5 win 65.5% · 0 battles 1396
  2. 2 Claude Sonnet 5.5 win 65.6% · 0 battles 1393
  3. 3 Kimi K3 win 62.1% · 0 battles 1360
  4. 4 Muse Spark 1.3 (xhigh) win 57.8% · 0 battles 1356
  5. 5 Claude Opus 5 win 60.5% · 0 battles 1349
  6. 6 Muse Spark 1.3 Max win 56.9% · 0 battles 1345
  7. 7 Qwen3.8 Max win 58.5% · 0 battles 1345
  8. 8 Claude Fable 5.1 win 59.6% · 0 battles 1342
  9. 9 MiMo-V2.6-Pro win 59% · 0 battles 1341
  10. 10 GLM-5.3 win 57.6% · 0 battles 1323
  11. 11 GLM-5.3-Flash win 55.1% · 0 battles 1323
  12. 12 Claude Fable 5 win 58.1% · 0 battles 1322
  13. 13 Gemini 3.8 Flash win 53.6% · 0 battles 1320
  14. 14 Muse Spark 1.2 win 52.1% · 0 battles 1305
  15. 15 Gemini 3.7 Flash win 52.3% · 0 battles 1304
  1. 1 Claude Opus 5.5 win 64.6% · 0 battles 1403
  2. 2 Claude Sonnet 5.5 win 65.2% · 0 battles 1377
  3. 3 GLM 5.1 win 67% · 5,939 battles 1366
  4. 4 Kimi K3 win 63.1% · 0 battles 1353
  5. 5 Claude Fable 5.1 win 61.8% · 0 battles 1348
  6. 6 Muse Spark 1.3 (xhigh) win 57.7% · 0 battles 1345
  7. 7 Muse Spark 1.2 win 58.4% · 0 battles 1344
  8. 8 MiMo-V2.6-Pro win 58.7% · 0 battles 1341
  9. 9 Claude Opus 5 win 58.7% · 0 battles 1336
  10. 10 Mistral Large 4 (High) win 59.6% · 0 battles 1333
  11. 11 Gemini 3.7 Flash win 55.5% · 0 battles 1323
  12. 12 Muse Spark 1.3 Max win 51.9% · 0 battles 1313
  13. 13 Claude Fable 5 win 57.6% · 0 battles 1309
  14. 14 Gemini 3.6 Flash win 52.4% · 0 battles 1294
  15. 15 GLM 5.2 win 52% · 0 battles 1290
  1. 1 Claude Opus 5.5 win 72.5% · 0 battles 1464
  2. 2 Claude Sonnet 5.5 win 66.7% · 0 battles 1426
  3. 3 Claude Fable 5.1 win 65.6% · 0 battles 1389
  4. 4 Kimi K3 win 61.3% · 0 battles 1368
  5. 5 Muse Spark 1.3 Max win 56.1% · 0 battles 1353
  6. 6 Claude Opus 5 win 59.1% · 0 battles 1345
  7. 7 Claude Fable 5 win 60.8% · 0 battles 1343
  8. 8 Muse Spark 1.3 (xhigh) win 54.4% · 0 battles 1339
  9. 9 Gemini 3.7 Flash win 53.7% · 0 battles 1329
  10. 10 Qwen3.8 Max win 53.5% · 0 battles 1325
  11. 11 GLM-5.3 win 52.9% · 0 battles 1323
  12. 12 MiMo-V2.6-Pro win 52.8% · 0 battles 1320
  13. 13 Gemini 3.8 Flash win 51% · 0 battles 1315
  14. 14 Grok 4.7 win 53.5% · 0 battles 1310
  15. 15 Muse Spark 1.2 win 50.3% · 0 battles 1310
  1. 1 Claude Opus 5.5 win 72.3% · 0 battles 1487
  2. 2 Muse Spark 1.3 Max win 63.7% · 0 battles 1404
  3. 3 Claude Fable 5.1 win 67.7% · 0 battles 1398
  4. 4 Kimi K3 win 67.7% · 0 battles 1396
  5. 5 Muse Spark 1.3 (xhigh) win 59% · 0 battles 1366
  6. 6 GLM-5.3 win 60.7% · 0 battles 1347
  7. 7 Qwen3.8 Max win 56.3% · 0 battles 1342
  8. 8 Claude Opus 5 win 59.8% · 0 battles 1340
  9. 9 MiMo-V2.6-Pro win 56.9% · 0 battles 1337
  10. 10 GLM 5.1 win 62.6% · 5,939 battles 1336
  11. 11 Claude Fable 5 win 61.8% · 0 battles 1324
  12. 12 GLM-5.3-Flash win 56.6% · 0 battles 1324
  13. 13 Gemini 3.7 Flash win 53.8% · 0 battles 1314
  14. 14 Muse Spark 1.2 win 52% · 0 battles 1309
  15. 15 Gemini 3.8 Flash win 49.9% · 0 battles 1301
  1. 1 Claude Opus 5.5 win 50.5% · 0 battles 1334
  2. 2 Muse Spark 1.3 Max win 53% · 0 battles 1322
  3. 3 Claude Opus 5 win 58.9% · 0 battles 1317
  4. 4 Muse Spark 1.3 (xhigh) win 55.4% · 0 battles 1306
  5. 5 Kimi K3 win 59.7% · 0 battles 1305
  6. 6 Claude Fable 5 win 62.6% · 0 battles 1303
  7. 7 Claude Fable 5.1 win 56.4% · 0 battles 1302
  8. 8 Gemini 3.8 Flash win 54.7% · 0 battles 1298
  9. 9 GLM-5.3 win 56.9% · 0 battles 1295
  10. 10 Muse Spark 1.2 win 55.8% · 0 battles 1290
  11. 11 GLM-5.3-Flash win 57.3% · 0 battles 1290
  12. 12 Gemini 3.7 Flash win 53.4% · 0 battles 1289
  13. 13 Gemini 3.1 Pro Preview win 67.8% · 0 battles 1285
  14. 14 Gemini 3.5 Flash win 58.6% · 0 battles 1254
  15. 15 Gemini 3 Pro Preview win 72.1% · 0 battles 1244
  1. 1 Claude Opus 5.5 win 65.3% · 0 battles 1407
  2. 2 Kimi K3 win 63.1% · 0 battles 1369
  3. 3 Muse Spark 1.3 (xhigh) win 57.3% · 0 battles 1358
  4. 4 Muse Spark 1.3 Max win 56.7% · 0 battles 1357
  5. 5 Claude Fable 5.1 win 59.3% · 0 battles 1341
  6. 6 Claude Opus 5 win 57.6% · 0 battles 1328
  7. 7 MiMo-V2.6-Pro win 52.4% · 0 battles 1321
  8. 8 Muse Spark 1.2 win 52% · 0 battles 1318
  9. 9 Claude Fable 5 win 57.7% · 0 battles 1315
  10. 10 GLM-5.3 win 54.9% · 0 battles 1313
  11. 11 Gemini 3.7 Flash win 54% · 0 battles 1313
  12. 12 Gemini 3.8 Flash win 50.3% · 0 battles 1309
  13. 13 Qwen3.8 Max win 52.7% · 0 battles 1298
  14. 14 Grok 4.6 win 52.6% · 0 battles 1296
  15. 15 Claude Opus 4.6 win 61.2% · 0 battles 1293
  1. 1 Riverflow 2.5 Pro win 64.1% · 0 battles 1297
  2. 2 MAI-Image-2.6 win 58% · 0 battles 1291
  3. 3 MAI-Image-2.6 Flash win 55.8% · 0 battles 1268
  4. 4 Gemini 3.1 Flash Image Gen 2K (Nano Banana 2) win 62.9% · 0 battles 1264
  5. 5 Gemini 3.1 Flash Image Gen (Nano Banana 2) win 61.1% · 0 battles 1249
  6. 6 MAI-Image-2.5 win 53.5% · 0 battles 1249
  7. 7 Gemini 3 Pro Image Gen 2K (Nano Banana Pro) win 61% · 0 battles 1242
  8. 8 GPT-Image-1 Mini win 51.4% · 0 battles 1210
  9. 9 FLUX.2 [flex] win 54% · 0 battles 1209
  10. 10 GPT-Image-1 win 52.7% · 0 battles 1202
  11. 11 FLUX.2 [pro] win 48.8% · 0 battles 1193
  12. 12 Gemini 3 Pro Image Preview win 54.2% · 0 battles 1182
  13. 13 Gemini 2.5 Flash Image (Nano Banana) win 51.4% · 0 battles 1170
  14. 14 Gemini 2.5 Flash Image Gen (Nano Banana) win 51.2% · 0 battles 1166
  15. 15 FLUX.2 Klein 4B win 37.9% · 0 battles 1060
  1. 1 Riverflow 2.5 Pro win 69.2% · 0 battles 1366
  2. 2 MAI-Image-2.6 win 60.9% · 0 battles 1318
  3. 3 MAI-Image-2.6 Flash win 60.1% · 0 battles 1306
  4. 4 Gemini 3.1 Flash Image Gen 2K (Nano Banana 2) win 65.1% · 0 battles 1277
  5. 5 Gemini 3.1 Flash Image Gen (Nano Banana 2) win 64.4% · 0 battles 1268
  6. 6 Gemini 3 Pro Image Gen 2K (Nano Banana Pro) win 62.1% · 0 battles 1244
  7. 7 MAI-Image-2.5 win 54.2% · 0 battles 1226
  8. 8 Gemini 3 Pro Image Preview win 60.4% · 0 battles 1217
  9. 9 FLUX.2 [flex] win 55.4% · 0 battles 1200
  10. 10 FLUX.2 [pro] win 49.1% · 0 battles 1195
  11. 11 GPT-Image-1 win 53.9% · 0 battles 1192
  12. 12 Gemini 2.5 Flash Image Gen (Nano Banana) win 55.6% · 0 battles 1187
  13. 13 GPT-Image-1 Mini win 51% · 0 battles 1184
  14. 14 Gemini 2.5 Flash Image (Nano Banana) win 53.4% · 0 battles 1179
  15. 15 FLUX.2 Klein 4B win 38.7% · 0 battles 1063

Source: Design Arena (www.designarena.ai) via OpenRouter (openrouter.ai/rankings). · as of 8 Oct 2026

โมเดลเปิดตัวล่าสุดNewest models

โมเดลที่เพิ่งเปิดให้ใช้งานผ่าน OpenRouter พร้อมราคาและ contextRecently released on OpenRouter, with pricing and context length

โมเดลModelเปิดตัวReleasedContextInput $/1MOutput $/1M
StepFun: Step 5 Previewstepfun/step-5-preview 8 Oct 2026 1M $1 $2.7
Anthropic: Claude Haiku 5.5anthropic/claude-haiku-5.5 8 Oct 2026 1M $0.1 $0.5
Anthropic: Claude Haiku 5.5 (batch)anthropic/claude-haiku-5.5:batch 8 Oct 2026 1M $0.05 $0.25
Google: Nano Banana 2.1google/gemini-nano-banana-2.1 6 Oct 2026 66K $1.5 $7.5
Mistral: Mistral Large 4mistralai/mistral-large-4-0 6 Oct 2026 1.0M $0.68 $2.09
inclusionAI: Ling 3.1 Flashinclusionai/ling-3.1-flash 2 Oct 2026 262K free free
Apodex: Apodex 1.1 Mini (free)apodex/apodex-1.1-mini:free 2 Oct 2026 262K free free
Pareto 26.10 Previewunbiased/pareto-26.10-preview 1 Oct 2026 1.0M $0.8 $3.2
OpenAI: GPT-6.1 Sol Proopenai/gpt-6.1-sol-pro 30 Sept 2026 1.1M $2 $10
OpenAI: GPT-6.1 Solopenai/gpt-6.1-sol 30 Sept 2026 1.1M $2 $10
Anthropic: Claude Sonnet 5.5anthropic/claude-sonnet-5.5 29 Sept 2026 1M $2 $10
Anthropic: Claude Sonnet 5.5 (batch)anthropic/claude-sonnet-5.5:batch 29 Sept 2026 1M $1 $5
TypeSafe: Jev Routertypesafe/jev-router 26 Sept 2026 1M $-1000000 $-1000000
Perceptron: Perceptron Mk1.5perceptron/perceptron-mk1.5 25 Sept 2026 37K $0.15 $1.5
Fireworks: Ember-1fireworks/ember-1 24 Sept 2026 1.0M $3 $15
Z.ai: GLM 5.3 Primez-ai/glm-5.3-prime 24 Sept 2026 1M $2.8 $8.8
Qwen: Qwen3.8 Max Primeqwen/qwen3.8-max-prime 24 Sept 2026 1M $4 $12
AionLabs: Aion 3.5 Miniaion-labs/aion-3.5-mini 23 Sept 2026 262K $0.7 $1.4
AionLabs: Aion 3.5aion-labs/aion-3.5 23 Sept 2026 262K $3 $6
Upstage: Solar Mini 4upstage/solar-mini4 23 Sept 2026 524K $0.05 $0.2

Source: OpenRouter models API (openrouter.ai/models) · 467 models

แหล่งข้อมูลและวิธีวัดData sources & methodology

ตัวเลขทั้งหมดดึงผ่าน OpenRouter Benchmarks API และ Models API ทุกคืน (01:00 น.) — เราไม่ได้ปรับแก้คะแนนAll numbers are pulled nightly (01:00 Bangkok) through the OpenRouter Benchmarks & Models APIs — we do not adjust any scores.

Artificial Analysis

บริษัทวิจัยอิสระที่รันชุดทดสอบมาตรฐานกับทุกโมเดลด้วยเงื่อนไขเดียวกัน แล้วสรุปเป็นดัชนี Intelligence, Coding และ Agentic พร้อมราคาต่อ tokenIndependent lab that runs the same standard eval suites on every model and publishes Intelligence, Coding and Agentic indexes plus token pricing.

ใช้ในแท็บUsed in: ฉลาดสุด · เขียนโค้ด · AgentIntelligence · Coding · Agents · 346 models · as of 8 Oct 2026

OpenRouter Evals

OpenRouter รันการทดสอบเองแบบทำซ้ำได้ ทุกคะแนนลิงก์ถึง config ค่าใช้จ่าย และ telemetry: GPQA Diamond (วิทยาศาสตร์), τ²-Bench Airline (agent เรียก tool) และชุดค้นเว็บ BrowseComp / WideSearch / DeepSearchQA / HLEReproducible evals run by OpenRouter, each linked to its config, cost and telemetry: GPQA Diamond, τ²-Bench Airline, and the BrowseComp / WideSearch / DeepSearchQA / HLE search suite.

ใช้ในแท็บUsed in: Agent · GPQA · AI ค้นเว็บWeb search · 316 results · as of 8 Oct 2026

Design Arena

ผู้ใช้จริงโหวตเทียบผลงาน (เว็บไซต์ UI กราฟ เกม 3D โลโก้ ฯลฯ) จากสองโมเดลโดยไม่เห็นชื่อ แล้วคำนวณคะแนน Elo และอัตราชนะReal users vote on blind side-by-side outputs (websites, UI, charts, games, 3D, logos…), aggregated into Elo ratings and win rates.

ใช้ในแท็บUsed in: ออกแบบ UIDesign · 14 categories · as of 8 Oct 2026

OpenRouter Models API

แคตตาล็อกโมเดลที่เปิดให้ใช้งานผ่าน API พร้อมวันเปิดตัว context window และราคา input / output ต่อ tokenCatalogue of models available via API with release date, context window and input / output token pricing.

ใช้ในแท็บUsed in: โมเดลใหม่ & ราคาNew & pricing · 467 models

ข้อมูลภายใต้สัญญาอนุญาต CC BY 4.0 ของ OpenRouter Rankings — แสดงเครดิตแหล่งต้นทางตามที่ API กำหนด · Benchmark วัดเฉพาะงานที่ทดสอบ ควรทดลองกับงานจริงของคุณก่อนเลือกใช้Rankings data is licensed CC BY 4.0 by OpenRouter — credited to each original source as the API specifies · Benchmarks cover only the tasks they test; try models on your own workload before choosing.