FlowTool: Controlling Tool Parameter in Image Retouching via Flow Matching
cs.CV
Submitted: 2026-09-28
Updated: 2026-09-28
Terminology
Sources
- Is Conditional Generative Modeling all you need for Decision-Making?
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- xVal: A Continuous Numerical Tokenization for Scientific Language Models
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Prompt-to-Prompt Image Editing with Cross Attention Control
- Planning with Diffusion for Flexible Behavior Synthesis
- OpenVLA: An Open-Source Vision-Language-Action Model
- CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
- Numeracy in Large Language Models: Fundamental Limitations and Paths to Improvement
- Decoding-based Regression
- Gemma 4 Technical Report
- Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
- ReAct: Synergizing Reasoning and Acting in Language Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models