LLM র‍্যাংকিং · আপডেট হয়েছে ৫ আগ, ২০২৬

The Definitive
LLM Leaderboard.

673টি ভাষা মডেল তুলনা 25টি বেঞ্চমার্ক, অ্যারেনা ভোট, দাম ও গতিতে — পাঁচটি স্বাধীন লিডারবোর্ড একত্রিত করে।

৫টি স্বাধীন লিডারবোর্ড থেকে সংকলিত:
Arena.ai · Artificial Analysis · LLM Stats · Vellum Leaderboard · LLMBase
llmpodium eval --benchmark suite
$llmpodium compare claude-mythos-preview vs claude-fable-5
EvaluatingRunning SWE-Bench, AIME, GPQA & Arena Elo...
Claude Mythos Preview: Score 97.4 · 80 t/s · Rank #1
Claude Fable 5: Score 93.4 · 71 t/s · 1509 Elo
Podium VerdictClaude Mythos Preview leads overall composite index
$
Tracked AI Labs
OpenAIAnthropicGoogle DeepMindMeta AIxAIDeepSeekMistral AIMoonshot AIAlibaba CloudCohereMicrosoftAmazonZhipu AIBaiduOpenAIAnthropicGoogle DeepMindMeta AIxAIDeepSeekMistral AIMoonshot AIAlibaba CloudCohereMicrosoftAmazonZhipu AIBaidu
673+
মডেল
Flagship curated
25
বেঞ্চমার্ক
Rigorous evals
44
প্রদানকারী
Global AI labs
719
অ্যারেনায় মডেল
Human battle Elo
01 · Real-Time Rankings

শীর্ষ মডেল

সব দেখুন →

Top 10 Models by Overall Podium Score

সব দেখুন →
#মডেলPodium Scoreঅ্যারেনা Eloকোডিংগতিদাম (আউটপুট)
01
Claude Mythos Preview
Anthropic · Proprietary
97.4
80.980 t/s$15/M
02
Claude Fable 5
Anthropic · Proprietary
93.4
150984.171 t/s$50/M
03
Kimi K3
Moonshot AI · Open Weights
83.3
148561.537 t/s$15/M
4
Claude Opus 5
Anthropic · Proprietary
81.4
149270.460 t/s$25/M
5
GPT-5.6 Sol
OpenAI · Proprietary
80.8
148364.872 t/s$30/M
6
Qwen3.8 Max
Alibaba · Proprietary
79.8
149650.355 t/s$2/M
7
Claude Opus 4.8
Anthropic · Proprietary
76.0
148458.050 t/s$15/M
8
Claude Opus 4 6 Thinking
Anthropic · Unknown
75.0
50 t/s$15/M
9
Claude Opus 4 7 Thinking
Anthropic · Unknown
75.0
50 t/s$15/M
10
Claude Opus 5 Max
Anthropic · Unknown
75.0
50 t/s$15/M
02 · Evaluation Domains

কাজ অনুযায়ী সেরা

সব দেখুন →
03 · Research & Analysis

সর্বশেষ নিবন্ধ

সব নিবন্ধ

Open LLM Intelligence Platform

Find the perfect model for your workflow.

Compare accuracy, price-per-token, latency, and real-world agent performance across 700+ language models in seconds.

04 · FAQ

সাধারণ প্রশ্ন

সম্পূর্ণ FAQ
প্রতিটি মডেল একটি Podium Score (০–১০০) পায় — চারটি সংকেতের ভারিত মিশ্রণ: ৩৫% মানুষের তুলনা থেকে অ্যারেনা Elo, ৩০% বেঞ্চমার্ক গড়, ২০% Artificial Analysis-এর Intelligence Index এবং ১৫% LLM Stats স্কোর। সব সংকেত একটি সাধারণ স্কেলে স্বাভাবিক করা হয়।
Claude Mythos Preview 97.4 নিয়ে শীর্ষে। এরপর Claude Fable 5 (93.4) এবং Kimi K3 (83.3)। নতুন ভোট ও ফলাফল এলে র‍্যাংকিং প্রতি সপ্তাহে বদলায়।
আমরা 18টি বিভাগে (কোডিং, গণিত, যুক্তি, এজেন্ট, জ্ঞান, মাল্টিমোডাল, দীর্ঘ কনটেক্সট, গতি, মূল্য ও ওপেন ওয়েট) 673টি ফ্ল্যাগশিপ মডেল বাছাই করি, সঙ্গে 719 মডেলের পূর্ণ অ্যারেনা টেবিল।
পাঁচটি পাবলিক লিডারবোর্ড থেকে: Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase। প্রতিটি উৎস প্রতি সপ্তাহে সিঙ্ক হয়; সঠিক সূত্র পদ্ধতি পাতায়।