MintAct: A Unified Visual Agent for Digital Environments
cs.CV
Submitted: 2026-09-18
Updated: 2026-09-18
Code: https://github.com/kakaobrain/coyo-dataset
Terminology
Sources
- AsyncWebRL: Efficient Asynchronous Reinforcement Learning for Multi-Step Visual Web Agents
- Qwen3-VL Technical Report
- SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent
- MolmoPoint: Better Pointing for VLMs with Grounding Tokens
- MolmoWeb: Open Visual Web Agent and Open Data for the Open Web
- AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training
- iOSWorld: A Benchmark for Personally Intelligent Phone Agents
- Weblica: Scalable and Reproducible Training Environments for Visual Web Agents
- Efficient Multi-turn RL for GUI Agents via Decoupled Training and Adaptive Data Curation
- Understanding R1-Zero-Like Training: A Critical Perspective
- MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents
- UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction
- UI-TARS: Pioneering Automated GUI Interaction with Native Agents
- Magistral
- Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism
- OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
- Agents' Last Exam
- InSTA: Towards Internet-Scale Training For Agents
- Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception
- MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models