AnesTRACE: Benchmarking Intraoperative Anesthesia from Multimodal Perception to Multi-step Decision-Making
cs.CV
Submitted: 2026-09-26
Updated: 2026-09-30
Project page: https://zjudbxai.github.io/AnesTRACE
Terminology
Sources
- gpt-oss-120b & gpt-oss-20b Model Card
- HealthBench: Evaluating Large Language Models Towards Improved Human Health
- Qwen3-VL Technical Report
- MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks
- Baichuan-M2: Scaling Medical Capability with Large Verifier System
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- LLaVA-OneVision: Easy Visual Task Transfer
- Fleming-R1: Toward Expert-Level Medical Reasoning via Reinforcement Learning
- AgentClinic: a multimodal agent benchmark to evaluate AI in simulated clinical environments
- MedGemma Technical Report
- Fleming-VL: Towards Universal Medical Visual Reasoning with Multimodal LLMs
- InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
- DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
- LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making
- Qwen3 Technical Report
- GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models
- LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
- MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models