Untangling Input Language from Reasoning Language: A Diagnostic Framework for Cross-Lingual Moral Alignment in LLMs
cs.CL, cs.AI
Submitted: 2026-01-15
Updated: 2026-09-27
Terminology
Sources
- Sycophantic AI Decreases Prosocial Intentions and Promotes Dependence
- Sycophancy in Large Language Models: Causes and Mitigations
- EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models
- Cross-Lingual Stability and Bias in Instruction-Tuned Language Models for Humanitarian NLP
- Value Imprint: A Technique for Auditing the Human Values Embedded in RLHF Datasets
- Large Language Models as Mirrors of Societal Moral Standards
- Normative Evaluation of Large Language Models with Everyday Moral Dilemmas
- Are Language Models Consequentialist or Deontological Moral Reasoners?
- Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
- Cross-Lingual Prompt Steerability: Towards Accurate and Robust LLM Behavior across Languages
- Moral Reasoning Across Languages: The Critical Role of Low-Resource Languages in LLMs
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering