Dense Clinical Contrasts Enhance Medical Knowledge Updating in Large Language Models
cs.AI
Submitted: 2026-08-31
Updated: 2026-08-31
Code: https://github.com/IflytekMedical-SouthChina/SeerBench
Terminology
Sources
- HealthBench: Evaluating Large Language Models Towards Improved Human Health
- MEDITRON-70B: Scaling Medical Pretraining for Large Language Models
- The Llama 3 Herd of Models
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats
- LoRA: Low-Rank Adaptation of Large Language Models
- MedGUIDE: Benchmarking Clinical Decision-Making in Large Language Models
- Mass-Editing Memory in a Transformer
- Orca: Progressive Learning from Complex Explanation Traces of GPT-4
- Capabilities of GPT-4 on Medical Challenge Problems
- A Blind Spot in Alignment: Quantifying Biosecurity Risks in Large Language Models
- LiveMedBench: A Contamination-Free Medical Benchmark for LLMs with Automated Rubric Evaluation
- Qwen3 Technical Report
- GLM-5: from Vibe Coding to Agentic Engineering
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection