Scoop
AI tool news · rumor vs. reality

Benchmarks ●

Rumors tracked. Announcements verified. Updated daily.

Frontier leaderboard + latest flagship per lab · updated 2026-09-25 · ← Back to headlines

Scores come from the labs themselves or public leaderboards, and benchmarks aren't directly comparable across models. Every benchmark links to its source; lab cards link each score to its source too.

Who leads where

Benchmark#1#2#3
Terminal-Bench 4.0Agentic coding · Anthropic#1Claude Opus 5.5
66.4%
#2GPT-6 Astra
57.9%
#3Claude Fable 5.1
55.8%
DeepSWE v1.1Software engineering · OpenAI, Tech Insider#1Muse Spark 1.3
75.4% (max reasoning, via Tech Insider)
#2GPT-6 Astra
74.1%
#3Claude Opus 5
73.7%
OSWorld 2.0Computer use · Anthropic, OpenAI (via Kingy AI)#1Claude Opus 5.5
81.8% (partial credit; different harness than OpenAI's)
#2Claude Fable 5.1
80.7% (partial credit)
#3GPT-6 Astra
72.6% (offline set)
SWE-bench VerifiedCoding · vals.ai#1Claude Opus 5
97.0%
#2GPT-5.6 Sol
96.2%
#3Grok 4.6
95.6%
AA Intelligence Index v4.3Overall intelligence · Artificial Analysis#1Claude Opus 5.5
58
#2Claude Fable 5.1
53 (tied)
#3GPT-6 Astra
53 (tied)
LMArena EloHuman preference · LMArena#1Claude Mythos 5
1531 (limited access)
#2Claude Fable 5
1525
#3Claude Opus 5
1522

Latest flagship per lab

OpenAI

GPT-6 AstraStory →released 2026-09-03
OSWorld 2.0 (computer use)72.6%via OpenAI (via MarkTechPost)
Terminal-Bench 4.057.9%via Anthropic (via VanDataTeam)
DeepSWE v1.174.1%via OpenAI (via WinBuzzer)
AA Intelligence Index v4.353 — tied #1via Artificial Analysis (via OfficeChai)

Anthropic

Claude Opus 5.5Story →released 2026-09-22
Terminal-Bench 4.066.4%via Anthropic (via AlphaCorp)
OSWorld 2.0 (computer use)81.8% partialvia Anthropic (via Kingy AI)
AA Intelligence Index v4.358 — #1 spotvia Vellum
HLE (with tools)67.7%via Anthropic (via AlphaCorp)

Meta

Muse Spark 1.3released 2026-09-02
AA Intelligence Index v4.1.162via Artificial Analysis (via SiliconANGLE)
DeepSWE v1.175.4% — #1 publishedvia Tech Insider
Terminal-Bench 2.188.8%via Tech Insider

xAI

Grok 4.7Story →released 2026-09-21
AA Intelligence Index v4.346via Artificial Analysis (via OfficeChai)
DeepSWE v1.171.0%via xAI (via VanDataTeam)

Google

Gemini 3.8 FlashStory →released 2026-09-02
AA Intelligence Index v4.1.159via Artificial Analysis (via The Decoder)
SWE-bench (independent)80.0%via Vals / BenchLM (via IntuitionLabs)
Terminal-Bench 2.1 (independent)81.3%via Vals (via IntuitionLabs)

Also noted

DeepSeek V4 Pro — SWE-bench Verified: 80.6% (Tech Insider)
← Back to headlines