
Sind die Agenten jetzt endlich da? Kann KI nun endlich selbstständig arbeiten? Dieser Blogpost hält dagegen und auch wenn ich ihn gleich zusammenfasse, solltet Ihr den Originaltext lesen, der ist nämlich voller guter & klarer Gedankengänge:
Im Kern geht es darum: Jedes Modell macht Fehler. Die entscheidende Frage für Autonomie lautet also nicht „wie klug ist mein Modell", sondern: Wer findet und beseitigt den Fehler, der unvermeidlich kommen wird?
Man kann das auf drei Szenarien verkürzen #
Niemand muss sich kümmern. Hier ist der Fehler nämlich billig und kann hingenommen werden: Entwürfe, Prototypen, alles, was man sonst einem Praktikanten geben würde und nicht so wichtig ist, dass man sich die Mühe einer gründlichen Qualitätskontrolle machen würde.
Ein maschinelles Review. In diesem Szenario kann die Aufgabe so präzise beschrieben werden, dass sich das Ergebnis automatisch prüfen lässt. Navier-Stokes1 war genau das: Das Theorem ist die Spezifikation, ein Beweisprüfer kann den Erfolg kontrollieren. Solche Aufgaben sind selten, und eine wasserdichte Spezifikation zu schreiben, ist oft teurer als die Arbeit selbst. Die Chipindustrie lebt das: dort kommen, laut dem Blogpost, auf einen Designer drei bis fünf Verifikationsingenieure.
Der Mensch kontrolliert. Das ist (aktuell) der Normalfall. Und es ist der Flaschenhals: Menschen lesen langsamer, als Modelle schreiben, und selbst erfahrene Reviewer ermüden bei dieser Tätigkeit, übersehen Dinge oder werden gezielt getäuscht (der xz-Backdoor lässt grüßen).
Die hohe Kunst der Fight-Club-Businesscase-Berechnung #
Es ist also vor allem ein Business Case: Was kostet uns ein Fehler, und wer kann ihn zu welchem Preis erkennen & beheben? Nur wo Fehler billig oder maschinell prüfbar sind, läuft KI wirklich allein. Enge, gut eingezäunte Aufgaben wie Kundenservice-Chats für Standardfälle helfen, weil dort weniger Fehler passieren können und die Leitplanken schon aus den Prozessvorgaben für menschliche Agents stehen. Überall sonst bestimmt der Mensch das Tempo, entweder als Spezifikationsgeber oder als Reviewer. Das ist der Unterschied zwischen Amodeis „Land voller Genies im Rechenzentrum"2 und dem, was uns im Alltag als AI begegnet: ein „Adorable Intern"3, der unter Aufsicht brillant performt, aber niemals alleingelassen werden sollte.
Brauchen wir Altman und Amodei noch? #
Von dort aus macht der Blogpost diese unangenehme Frage auf: Die Fälle, in denen Fehler billig sind oder die Aufgabe eng, brauchen vermutlich meist keine Spitzenmodelle. Und für die anspruchsvollen Fälle mit maschineller Prüfung vermutet der Autor, dass die Breite des Schwarms mehr zählt als die Tiefe des einzelnen Modells, weil der Prüfer die Qualität sichert. Wenn beides stimmt, bleibt für teure Frontier-Modelle vor allem eine Rolle: das Werkzeug in der Hand des menschlichen Reviewers. Alles andere könnten günstige Open-Weight-Modelle auf eigener Hardware übernehmen, bei denen die Daten im Haus bleiben.
Sollte sich das bewahrheiten, sind die Frontier-Modell-Anbieter massiv überbewertet und der daraus resultierende Schaden wird zusätzlich auch die Datacenter- und Hardware-Anbieter treffen.
Die Navier-Stokes-Gleichungen sind ein mathematisches Modell der Strömung von linear-viskosen newtonschen Flüssigkeiten und Gasen. OpenAI hat hier mit massivem AI-Aufwand (10.000 Agenten!) einen Beweis erarbeitet. Details zum Problem und dem AI-Ansatz sind in der Wikipedia besser beschrieben, als ich es könnte, der ich Physik nach der 11. Klasse abgewählt habe:
↩︎Diese Formulierung stammt aus Amodeis vielzitiertem Blogpost und illustriert dessen Vision, dass bald Millionen KI-Instanzen wie ein ganzes Land voller Nobelpreisträger selbstständig forschen und arbeiten, nur begrenzt durch verfügbare Rechenleistung.
Jay Kruer entgegnet: Diese Vision setzt zwingend voraus, dass die Modelle ohne menschliche Prüfung laufen. Folglich sieht er zwingend einen menschlichen Flaschenhals und witzelt über das fortlaufend leere Versprechen, dass die AI-Revolution kurz bevor stehe und ganz sicher demnächst kommen werde. ↩︎Diesen Kalauer versuche ich jetzt bereits seit über zwei Jahren bei jeder sich bietenden Gelegenheit unterzubringen und obgleich er mich selbst immer noch sehr erheitert, scheint er nicht zu verfangen. Werden Sie Teil der Bewegung und helfen Sie bei der Verbreitung dieses Memes! ↩︎