in the loop

o1-preview
#143 of 274 scored.

OpenAISep 12, 2024Closed

Capabilities Index

Range 130.8–138.7

134.8

Context

Tokens

—

Input

Per 1M tokens

—

Output

Per 1M tokens

—

Benchmarks

How it scores.

  • GPQA Diamond33.8%

    133rd of 186

  • Mock AIME31.0%

    120th of 176

Everything else Epoch has for it

  • MATH level 581.7%
  • WeirdML47.6%
  • METR Time Horizons45.1%
  • SimpleBench30.0%
  • ARC-AGI18.0%
  • Cybench10.0%

On the index

Around it.

  1. #140Gemini 2.0 Flash Thinking (Jan 2025)Google135.4
  2. #141Gemini 2.0 ProGoogle135.1
  3. #142GPT-4.1 miniOpenAI · $0.40 in135.0
  4. #143o1-previewOpenAI134.8
  5. #144Gemini 2.0 Flash (Feb 2025)Google134.7
  6. #145Gemini 2.0 Flash (Dec 2024)Google134.7
  7. #146Mistral Medium 3Mistral · $0.40 in134.1

Sources