First Token Matters: Understanding Safety Collapse in Large Reasoning Models

arXiv:2609.18471 · cs.AI · Submitted 2026-09-16 · Read on arXiv

cs.AI

Submitted: 2026-09-16

Updated: 2026-09-16

Comments: 18 pages, 7 figures, 10 tables. Includes appendices. Accepted at CICAI 2026

Code: https://github.com/tatsu-lab/stanford_alpaca

License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/

Terminology

Sources

Related papers