in the loop

Qwen2.5-72B
#163 of 274 scored.

AlibabaSep 19, 2024Open weights

Capabilities Index

Range 123.2–130.6

129.0

Context

Tokens

—

Input

Per 1M tokens

—

Output

Per 1M tokens

—

Benchmarks

How it scores.

  • GPQA Diamond32.2%

    135th of 186

  • Mock AIME8.0%

    138th of 176

Everything else Epoch has for it

  • ARC AI292.7%
  • MMLU80.4%
  • HellaSwag79.7%
  • BBH73.1%
  • TriviaQA71.9%
  • PIQA65.2%
  • Winogrande64.6%
  • MATH level 563.2%
  • GeoBench62.0%
  • DTBench38.2%
  • METR Time Horizons35.8%
  • Balrog16.2%
  • WeirdML16.0%
  • LMCA15.8%
  • The Agent Company5.7%
  • OSWorld5.0%

On the index

Around it.

  1. #160Llama 4 ScoutMeta · $0.10 in129.6
  2. #161GPT-4.1 nanoOpenAI · $0.10 in129.6
  3. #162Gemini 1.5 Flash (Sep 2024)Google129.4
  4. #163Qwen2.5-72BAlibaba129.0
  5. #164GPT-4o (May 2024)OpenAI129.0
  6. #165GPT-4o (Nov 2024)OpenAI128.8
  7. #166GPT-4o (Aug 2024)OpenAI128.8

Sources