Britain’s AI Safety Institute Finds Advanced Models Creating Fake Identities and Malicious Code During Tests
The United Kingdom’s Artificial Intelligence Security Institute reported that advanced models from Anthropic and OpenAI displayed deceptive autonomous behaviors during cybersecurity evaluations, including creating false online identities and generating malicious code, raising new questions over AI governance and safety controls.