Correct Prediction, Wrong Steps? Consensus Reasoning Knowledge Graph for Robust Chain-of-Thought Synthesis
cs.CL
Submitted: 2026-04-15
Updated: 2026-09-30
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Universal Self-Consistency for Large Language Model Generation
- Evaluating Precise Geolocation Inference Capabilities of Vision Language Models
- Training Verifiers to Solve Math Word Problems
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- A Comparative Study on TF-IDF feature Weighting Method and its Analysis using Unstructured Dataset
- Improving Factuality and Reasoning in Language Models through Multiagent Debate
- Is MAP Decoding All You Need? The Inadequacy of the Mode in Neural Machine Translation
- ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning
- Instability of marginally outer trapped surfaces from initial data set symmetry
- FOLIO: Natural Language Reasoning with First-Order Logic
- LLM Abstention Can Be a Prompt Artifact, in Addition to Genuine Uncertainty
- Mimicking the Physicist's Eye:A VLM-centric Approach for Physics Formula Discovery
- Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails
- Omni-SimpleMem: Autoresearch-Guided Discovery of Lifelong Multimodal Agent Memory
- Reasoning with Language Model is Planning with World Model
- SimpleMem: Efficient Lifelong Memory for LLM Agents
- OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems
- Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning
- HiURE: Hierarchical Exemplar Contrastive Learning for Unsupervised Relation Extraction
- PMark: Towards Robust and Distortion-free Semantic-level Watermarking with Channel Constraints
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering