ToolSearcher: Optimizing Tool Selection at Scale via Reinforcement Learning
cs.CL
Submitted: 2026-09-25
Updated: 2026-09-25
Code: https://github.com/zhenlongDai/ToolSearcher
Terminology
Sources
- SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training
- From Local to Global: A Graph RAG Approach to Query-Focused Summarization
- Retrieval-Augmented Generation for Large Language Models: A Survey
- Unveiling Large Language Model Supply Chain: Structure, Domain, and Vulnerabilities
- Long-Context LLMs Meet RAG: Overcoming Challenges for Long Inputs in RAG
- Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
- A Survey of Reinforcement Learning from Human Feedback
- LLM Post-Training: A Deep Dive into Reasoning Large Language Models
- GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
- HyperGraphRAG: Retrieval-Augmented Generation via Hypergraph-Structured Knowledge Representation
- MARAG-R1: Beyond Single Retriever via Reinforcement-Learned Multi-Tool Agentic Retrieval
- ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs
- Proximal Policy Optimization Algorithms
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- GISTEmbed: Guided In-sample Selection of Training Negatives for Text Embedding Fine-tuning
- R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning
- MINT: Evaluating LLMs in Multi-turn Interaction with Tools and Language Feedback
- Qwen3 Technical Report
- Qwen2.5 Technical Report
- Arctic-Embed 2.0: Multilingual Retrieval Without Compromise
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering