Rethinking Personalized Generation: Test-Time Alignment via Factorized Ranking Models
cs.LG, cs.CL
Submitted: 2026-09-28
Updated: 2026-09-28
Code: https://github.com/Martin-qyma/Rethinking-Personalized-Generation
Terminology
Sources
- Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback
- LoRe: Personalizing LLMs via Low-Rank Reward Modeling
- PAL: Pluralistic Alignment Framework for Learning from Heterogeneous Preferences
- The Era of Real-World Human Interaction: RL from User Conversations
- ARGS: Alignment as Reward-Guided Search
- Cascade Reward Sampling for Efficient Decoding-Time Alignment
- Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
- Decoupled Weight Decay Regularization
- Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown
- Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
- T-POP: Test-Time Personalization with Online Preference Feedback
- Qwen2.5 Technical Report
- Language Model Personalization via Reward Factorization
- A Roadmap to Pluralistic Alignment
- Instant Personalized Large Language Model Adaptation via Hypernetwork
- GenARM: Reward Guided Generation with Autoregressive Reward Model for Test-time Alignment
- A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?
- BERTScore: Evaluating Text Generation with BERT
- Group Preference Optimization: Few-Shot Alignment of Large Language Models
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks