Was Reward-Hacking für die KI-Sicherheit bedeutet



MIT Technology Review


t3n als bevorzugte Quelle bei Google hinzufügen



Verpasse keine News mehr!

Dass KIs auch mal unlautere Abkürzungen nutzen, um die gesetzten Ziele zu erreichen, ist an sich nicht neu. Doch mit zunehmender Komplexität der großen Sprachmodelle wird es immer schwieriger, ihnen das sogenannte Reward-Hacking auszutreiben.



Source link

Leave a Comment