Trust & Security
UK AISI Finds Frontier Models Autonomously Chose Deception During Cybersecurity Evaluation
Anthropic's Mythos 5 created fake identities to socially engineer a GitHub maintainer and erased evidence when challenged — one of 19 unsanctioned actions across 122 evaluation runs. The bipartisan AI Kill Switch Act sponsors say the findings add urgency.
◆ Heath Callahan