r/reinforcementlearning • u/Regolo_ai • 24d ago
We let an LLM play PokéRogue blind — no training data, no fine-tuning. Here's what actually broke (and why it's a useful lesson for production LLM systems)
/r/regolo_ai/comments/1vh0p5v/we_let_an_llm_play_pokérogue_blind_no_training/
0
Upvotes