OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video
cs.CV
Submitted: 2026-10-08
Updated: 2026-10-08
Code: https://github.com/appletea233/OneSearch-VL
Terminology
Sources
- Qwen3-VL Technical Report
- Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity
- OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents
- Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?
- SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent
- Video-R1: Reinforcing Video Reasoning in MLLMs
- OneThinker: All-in-one Reasoning Model for Image and Video
- Seeking and Updating with Live Visual Knowledge
- VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning
- WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent
- DeepEyesV2: Toward Agentic Multimodal Model
- Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
- Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models
- SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation
- Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
- Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking
- VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning
- Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models