The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation Paper • 2607.24720 • Published 30 days ago • 26
Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do Paper • 2606.22565 • Published Jun 21 • 9
Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It Paper • 2606.26027 • Published Jun 24 • 18
Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It Paper • 2606.26027 • Published Jun 24 • 18
Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do Paper • 2606.22565 • Published Jun 21 • 9
FinRAGBench-V: A Benchmark for Multimodal RAG with Visual Citation in the Financial Domain Paper • 2505.17471 • Published May 23, 2025
Whispers that Shake Foundations: Analyzing and Mitigating False Premise Hallucinations in Large Language Models Paper • 2402.19103 • Published Feb 29, 2024
MIRAGE: Evaluating and Explaining Inductive Reasoning Process in Language Models Paper • 2410.09542 • Published Oct 12, 2024
Focus on Your Question! Interpreting and Mitigating Toxic CoT Problems in Commonsense Reasoning Paper • 2402.18344 • Published Feb 28, 2024 • 1
Fixing the Broken Compass: Diagnosing and Improving Inference-Time Reward Modeling Paper • 2503.05188 • Published Mar 7, 2025
MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning Paper • 2603.02024 • Published Mar 2 • 47
Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models Paper • 2603.11896 • Published Mar 12 • 10
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models Paper • 2408.10682 • Published Aug 20, 2024
RULE: Reinforcement UnLEarning Achieves Forget-Retain Pareto Optimality Paper • 2506.07171 • Published Jun 8, 2025 • 1
Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application Paper • 2606.12191 • Published Jun 10 • 71
Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application Paper • 2606.12191 • Published Jun 10 • 71
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences Paper • 2510.23451 • Published Oct 27, 2025 • 28
Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis Paper • 2506.04142 • Published Jun 4, 2025 • 28
MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos Paper • 2506.04141 • Published Jun 4, 2025 • 31
RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment Paper • 2412.13746 • Published Dec 18, 2024 • 9