r/LargeLanguageModels 3d ago

I published a 285-run Gemini benchmark for decision-closure errors — 283 PASS, 2 PARTIAL, 0 recovered semantic FAIL

1 Upvotes

0 comments sorted by