VisCritic: Visual State Comparison as Process Reward for GUI Agents
cs.CV
Submitted: 2026-06-23
Updated: 2026-06-23
Terminology
Sources
- MobileDreamer: Generative Sketch World Model for GUI Agent
- GUI-Shepherd: Reliable Process Reward and Verification for Long-Sequence GUI Tasks
- Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- Do Multi-Agents Dream of Electric Screens? Achieving Perfect Accuracy on AndroidWorld Through Task Decomposition
- Computer-Using World Model
- Guiding VLM Agents with Process Rewards at Inference Time for GUI Navigation
- CRAFT-GUI: Curriculum-Reinforced Agent For GUI Tasks
- Representation Learning with Contrastive Predictive Coding
- GPT-4 Technical Report
- Visual Inception: Compromising Long-term Planning in Agentic Recommenders via Multimodal Memory Poisoning
- Penny Wise, Pixel Foolish: Bypassing Price Constraints in Multimodal Agents via Visual Adversarial Perturbations
- Qwen2.5-VL Technical Report
- Agent Alpha: Tree Search Unifying Generation, Exploration and Evaluation for Computer-Use Agents
- Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception
- GUI-PRA: Process Reward Agent for GUI Tasks
- Dyna-Mind: Learning to Simulate from Experience for Better AI Agents
- Adaptive Milestone Reward for GUI Agents
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models