arlen/bench
LiveEvals
Builder & maintainer · arlenkumar.com/bench
A vendor-neutral leaderboard for the web-search, extraction, and identity APIs AI agents buy mid-task — hand-verified golden sets, deterministic scoring, and machine surfaces (llms.txt, Atom, an MCP server). Missing coverage renders as —, never 0.
# systems[1]
id: arlen-bench type: evals/leaderboard status: live
role: builder & maintainer geo16_self_score: 0.90
metrics: hit@k, cost-per-correct, KM freshness-lag, public/holdout overfit gap
machine_surface: /bench/llms.txt, /bench/feed.xml, /bench/.well-known/mcp.json
last_verified: 2026-06-12 links: /bench