A Survey of LLM Prompt Datasets: Taxonomy, Linguistic Patterns, and Practical Uses
cs.LG, cs.CL
Submitted: 2025-10-10
Updated: 2026-08-27
Code: https://github.com/tatsu-lab/stanford_alpaca
Terminology
Sources
- OpenCodeInstruct: A Large-scale Instruction Tuning Dataset for Code LLMs
- Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback
- HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs
- FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance
- PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding
- UltraFeedback: Boosting Language Models with Scaled AI Feedback
- Rephrase and Respond: Let Large Language Models Ask Better Questions for Themselves
- Scaling Synthetic Data Creation with 1,000,000,000 Personas
- LongForm: Effective Instruction Tuning with Reverse Instructions
- Bactrian-X: Multilingual Replicable Instruction-Following Models with Low-Rank Adaptation
- Datasets for Large Language Models: A Comprehensive Survey
- Beyond Prompt Content: Enhancing LLM Performance via Content-Format Integrated Prompt Optimization
- Crosslingual Generalization through Multitask Finetuning
- RouteLLM: Learning to Route LLMs with Preference Data
- PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models
- CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark
- The Prompt Report: A Systematic Survey of Prompt Engineering Techniques
- Instruction Tuning for Large Language Models: A Survey
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks