CheckerBench: Can Long-Horizon Agents Synthesize Static-Analysis Checkers? Paper • 2610.07557 • Published 6 days ago • 67
STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization Paper • 2609.38169 • Published 13 days ago • 118
Learn2Play Bench: How Well Do LLM Agents Learn from Experience in Unfamiliar Environments? Paper • 2610.08215 • Published 4 days ago • 137