3 ms·
(Edit: Updated results + Windsurf coding demo showing same 40%→100% pattern in production AI workflows. Domain grounding > model scale.) Compositional Chaining
by MysticBirdie 7mo ago
(Edit: Updated results + Windsurf coding demo showing same 40%→100% pattern in production AI workflows. Domain grounding > model scale.) Compositional Chaining Benchmark — by Chain Type
Chain Type
Triad: 81.8%
Raw: 72.7%
∆ (Triad–Raw): +9.1pp
FAULT_INJECTION
Triad: 100%
Raw: 71.4%
∆: +28.6pp
CROSS_CHARACTER
Triad: 50%*
Raw: 100%
*Triad cross-char losses were 100% rate limit timeouts (ERRORs), not model mistakes.
Depth Drift — Accuracy vs. Hops
Step | Triad | Raw
1⃣ 75% | 87.5%
2⃣ 75% | 75%
3⃣ 83.3% | 66.7% ← Raw degrades
4⃣ 100% | 100%
5⃣ 100% | 100%
Raw drops 21pp between steps 1–3, while Triad improves.
Fault Injection — The Key Result
Injected Error | Triad | Raw
Hadrian’s Wall as existing | PASS | FAIL
Julius Caesar as living | PASS | PASS
Paper money replacing coins | PASS | FAIL
Triad: 3/3. Raw: 1/3.
In short: Triad consistently maintains compositional reasoning under stress and even strengthens across depth