MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
cs.CL, cs.AI, cs.CV
Submitted: 2025-08-14
Updated: 2026-08-31
Code: https://github.com/MMBrowseComp/MM-BrowseComp
Terminology
Sources
- Qwen2.5-VL Technical Report
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models
- GPT-4o System Card
- MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines
- Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
- LLaVA-OneVision: Easy Visual Task Transfer
- SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
- WebSailor: Navigating Super-human Reasoning for Web Agent
- GraphReader: Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Models
- Search-o1: Agentic Search-Enhanced Large Reasoning Models
- DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models
- MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts
- ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning
- WebGPT: Browser-assisted question-answering with human feedback
- R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning
- Llama 2: Open Foundation and Fine-Tuned Chat Models
- ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents
- Measuring short-form factuality in large language models
- BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering