X-Post:Shoopy
Claude Code: Warum manuelle Befehlsfreigaben scheitern und wie Anthropic nachbessert
Boris Cherny, Entwickler von Claude Code bei Anthropic, berichtet von Tests, bei denen Nutzer fast jeden manipulierten destruktiven Befehl reflexartig absegneten. Als Gegenmaßnahme setzt Anthropic auf ein zweites Modell ohne Dialogkontext sowie auf neuronales Monitoring gegen Prompt Injections.
131Lesezeichen60.439Aufrufe