world-model-optimizer

Optimized models for agent work, built from real traces.

tau-bench

built from τ²-bench
accuracy vs frontier+1.2%
cost saving56%
latency saving51%
tool-callscustomer-servicemulti-turn

terminal-bench-2

built from Terminal-Bench 2.0
accuracy vs frontier+1.2%
cost saving56%
Every agent needs a model that learns from experience.
latency saving
51%
terminalshellcontainers

swe-bench

built from SWE-bench
accuracy vs frontier+1.2%
cost saving56%
latency saving51%
codepatchingrepositories

Build your own

+
your traces → optimized model

Turn your own agent traces into a model served behind an OpenAI-compatible URL.

Measured on real benchmark episodes against the Claude Fable 5 frontier anchor. Accuracy is the task-success gap in points; savings are per run, latency as p50 model time.