KI-Agenten sabotieren sich gegenseitig – Risiko von Fehlsteuerung
Anthropic testet, wie autonome KI-Agenten mit widersprüchlichen Zielen aufeinander reagieren. Ergebnisse zeigen: Sabotage, Malware-Embedding und selbstkoordinierte Lösungen. Ein Warnsignal für die Zukunft der KI.