Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning
cs.CV, cs.AI, cs.CL
Submitted: 2026-08-17
Updated: 2026-09-01
Terminology
Sources
- Toward Native Multimodal Modeling: A Roadmap
- Qwen3-VL Technical Report
- VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
- VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
- MatchLM2Lite: A Scalable MLLM-to-Lite Framework for Reproduced Content Identification
- Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition
- Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization
- Training Large Language Models to Reason in a Continuous Latent Space
- Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos
- LUT: Latent Utility Training for Visual Reasoning
- Latent Visual Reasoning
- LLaVA-OneVision: Easy Visual Task Transfer
- Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation
- Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding
- VISD: Enhancing Video Reasoning via Structured Self-Distillation
- TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning
- Visual-Advantage On-Policy Distillation for Vision-Language Models
- Youtu-LLM: Unlocking the Native Agentic Potential for Lightweight Large Language Models
- Efficient Reasoning with Hidden Thinking
- Kimi K3: Open Frontier Intelligence
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models