AI agents fail reasoning tasks on GPT-4o & Claude Opus. My hypothesis: "token clustering" optimization compromises complex LLM reasoning. Here's my fix.