Hermosa AI
Loading...
Topics
Agent Evals and Benchmarks
49 evals
[
monthly
]
2026-07-17
MATH-500
SWE-bench Verified
GPQA-Diamond
MAST (Multi-Agent System Failure Taxonomy)
JudgeBench
Chatbot Arena
Arena-Hard-Auto
RewardBench 2
MultiAgentBench
BattleAgentBench
τ-bench
GAIA
OSWorld
BrowseComp
PlanBench-XL
SWE-bench Pro
LiveCodeBench
BigCodeBench
SWE-bench Multimodal
Multi-SWE-bench
SWE-Lancer
Commit0
Terminal-Bench
KernelBench
CanItEdit
RepoBench
USACO
EvoCodeBench
CodeContests
DevBench
SOTOPIA
MAgIC
COMMA (Communicative Multimodal Multi-Agent Benchmark)
LLM-Coordination Benchmark
Alem
GPTNT
Paired Noise-Floor Protocol for Multi-Agent LLM Benchmarks
MAESTRO
DevicesWorld
PolyWorkBench
MAG (Multimodal Action and Guide)
Relay-Bench
HANDBOOK.md
Bazaar
OSWorld 2.0
GABench
AI4AI-Bench
SRE-Bench
MobileJudgeBench