XYZ Forge

Models & Harnesses Tested

Every harness and model XYZ has been evaluated with, from the committed harnesses registry. Full narratives live in the repo's HARNESS-MODELS-REGISTRY.md; benchmark artifacts in TESTS-RESULTS/.

Evaluated pairs — grades

HarnessModelGradeGateDiff cleanliness /5Seam reliability /5Failure modeEvals
commandcodeQwen 3.8-MaxA-✓ passed55none24
dshdeepseek/deepseek-v4-proA✓ passed55none1

Grades come from the evaluations ledger: A-range means the pairing is production-usable as driven; B-range usable with caveats; C or N/A means not recommended for that pairing. “Evals” counts the individual verified invocations behind each row.

Harnesses

IDNameEngineReasoning effortStanding role
agyAntigravity CLInative_cliyesCost-blind cross-model builder/reviewer
aiderAiderpython_litellmnoBuilder only
claudeClaude Codenative_cliyesOrchestrator and final reviewer
codexCodex CLInative_cliyesCost-blind default builder and reviewer
commandcodeCommand Codenode_langbaseyesBuilder & Systems Reviewer
dshDeepSeek Harnessnode_cordisyesAutonomous Headless Builder
museMuse Codenative_cliyesEvaluation only (GH-518)
piPi Agentnode_multinoBuilder only

Models

ModelLabGatewayContextStatus
Qwen 3.7-FlashAlibabaopenrouter1Mactive
Qwen 3.8-MaxAlibabaopenrouter1Mactive
antigravity/gemini-2.5-proAntigravitygoogle1Mactive
Gemini 3.5 FlashAutogoogle1Mactive
claude-sonnet-4-6Autoanthropic1Mactive
deepseek/deepseek-v4-proAutoopenrouter1Mactive
qwen3.8-maxAutoalibaba1Mactive
DeepSeek V3DeepSeekopenrouter1Mactive
DeepSeek V4 ProDeepSeekopenrouter1Mactive
Gemma 4 31B QATGooglelmstudio32,768active
Muse Spark 1.3Metameta1,007,997active
Muse Spark 1.3 ContributorMetameta1,007,997active
openai/gpt-mini-latestOpenaipi1Mactive
openrouter/qwen/qwen3.8-maxQwenopenrouter1Mactive
qwen/qwen3.8-maxQwenopenrouter1Mactive
qwen/qwen3.8-max-0902Qwenopenrouter1Mactive
Stealth Ox-AlphaStealthopenrouter1Mactive
stealth/ox-alphaStealthopenrouter1Mactive
GLM 5.3 HighZ.aiopenrouter1Mactive
zai-org/glm-5.3Zai-orgopenrouter1Mactive