The Rise of Verbal Reinforcement Learning
cs.CL, cs.AI
Submitted: 2026-09-01
Updated: 2026-09-01
Terminology
Sources
- Constitutional AI: Harmlessness from AI Feedback
- A Framework for Testing and Adapting REST APIs as LLM Tools
- Design Patterns for Securing LLM Agents against Prompt Injections
- Grounding LLMs For Robot Task Planning Using Closed-loop State Feedback
- GPT-4 Technical Report
- Do As I Can, Not As I Say: Grounding Language in Robotic Affordances
- ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate
- Concrete Problems in AI Safety
- SecAlign: Defending Against Prompt Injection with Preference Optimization
- Memory for Autonomous LLM Agents:Mechanisms, Evaluation, and Emerging Frontiers
- BabyAI: A Platform to Study the Sample Efficiency of Grounded Language Learning
- KTO: Model Alignment as Prospect Theoretic Optimization
- RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning
- Compositional Instruction Following with Language Models and Reinforcement Learning
- ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving
- iGRPO: Self-Feedback-Driven LLM Reasoning
- BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
- PaLM-E: An Embodied Multimodal Language Model
- Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning
- Process Reward Models That Think
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering