WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity Paper • 2608.02603 • Published 5 days ago • 34 • 3
WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity Paper • 2608.02603 • Published 5 days ago • 34
SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration Paper • 2607.15257 • Published 23 days ago • 72
Toward Generalist Autonomous Research via Hypothesis-Tree Refinement Paper • 2606.11926 • Published Jun 10 • 130
From Prompt Injection to Persistent Control: Defending Agentic Harness Against Trojan Backdoors Paper • 2605.31042 • Published May 29 • 20
PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language Models Paper • 2605.20873 • Published May 20 • 44
From Matching to Generation: A Survey on Generative Information Retrieval Paper • 2404.14851 • Published Apr 23, 2024
Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning Paper • 2505.16410 • Published May 22, 2025 • 60
Hierarchical Document Refinement for Long-context Retrieval-augmented Generation Paper • 2505.10413 • Published May 15, 2025
Leveraging LLM-Assisted Query Understanding for Live Retrieval-Augmented Generation Paper • 2506.21384 • Published Jun 26, 2025 • 1
Decoupled Planning and Execution: A Hierarchical Reasoning Framework for Deep Search Paper • 2507.02652 • Published Jul 3, 2025 • 26
DeepAgent: A General Reasoning Agent with Scalable Toolsets Paper • 2510.21618 • Published Oct 24, 2025 • 103
TourPlanner: A Competitive Consensus Framework with Constraint-Gated Reinforcement Learning for Travel Planning Paper • 2601.04698 • Published Jan 8 • 10
CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks Paper • 2603.18736 • Published Mar 19