$ ls ~/tags

Benchmark

shipped

Skynet Breakage Atlas

Adversarial multi-model failure atlas — subscription controls (Claude / Codex / Grok) vs Skynet fleet cells, with flag rates, empty replies, hard errors, and latency.

Read more
active

Model Bench

Empirical cross-provider LLM benchmark — 22,522 trials × 64 models × 9 tasks, with subscription-vs-public-API cost columns side-by-side and industry-benchmark side tracks.

Read more