Kurz gefasst. Vor elf Tagen haben wir argumentiert, dass der schwierige Teil eines persönlichen Assistenten nicht das Modell ist, sondern überhaupt an Ihr Leben heranzukommen. Vergangene Woche hat Nvidia eine Untersuchung veröffentlicht, die auf einen zweiten Engpass zeigt, der ebenfalls nicht das Modell ist: die Software, die darum herum gebaut ist. Gleiche Schlussfolgerung, anderer Mechanismus, und zusammen decken sie den Großteil dessen ab, was tatsächlich darüber entscheidet, ob ein Assistent etwas taugt. Wir halten das für persönliche KI relevanter als für alles andere, und wir sagen weiter unten, warum dieser Teil unsere Behauptung ist und nicht ihre.

Am 14. August haben wir einen Beitrag veröffentlicht, der argumentiert, dass der Engpass nie das Modell war. Kurzfassung: „perfekter Kontext Ihres gesamten Lebens“ ist eine Aussage über Daten, nicht über Intelligenz. Ihr Leben steckt in zehn Jahren Mail, in einer Nachrichten-Datenbank, die bis zu Ihrem ersten iPhone zurückreicht, und in einem WhatsApp-Export, den es offiziell nicht gibt. Auf einem Mac liegt jedes davon hinter einer Berechtigungsschranke, und diese Schranken öffnen sich nicht für ein klügeres Modell.

Am 21. August hat Nvidia eine Untersuchung veröffentlicht, die aus einer völlig anderen Richtung bei derselben Schlussfolgerung landet.

Was sie tatsächlich herausgefunden haben

Sie haben Claude Opus 5 genommen und gegen ARC-AGI-3 laufen lassen, einen Reasoning-Benchmark. Unverändert erreichte es 30 %. Dann haben sie das Modell vollständig in Ruhe gelassen und die Software darum herum neu gebaut: das Werkzeugset, die Art, wie Gedächtnis und Kontext verwaltet werden, wie Rückmeldungen zum Agenten zurückfließen, dazu eine überwachende Komponente, die eingreift, wenn der Agent abschweift. Dasselbe Modell. Das Ergebnis stieg auf 100 %.

Nvidia nennt diese Hülle das Harness. Ihr Vice President Adel El Hallak hat es etwa so unverblümt gesagt, wie man es sagen kann: „Es ist das Modell. Es ist das Gerüst um das Modell herum, das wir Harness nennen.“

Sie sind nicht der einzige Datenpunkt in dem Artikel. OpenAI soll seine eigene ARC-AGI-3-Punktzahl verdreifacht haben, indem es zwei Harness-Einstellungen geändert hat. Databricks wird mit dem Befund zitiert, dass die Wahl des Harness die Betriebskosten um den Faktor zwei bewegen kann, also stärker als die Wahl des Modells.

Zwei verschiedene Engpässe, und es lohnt sich, da genau zu sein

Es wäre einfach und ein wenig unredlich, wenn wir das als Bestätigung genau dessen darstellen würden, was wir geschrieben haben. Das ist es nicht ganz, und der Unterschied ist der interessante Teil.

Unser Engpass ist, die Daten überhaupt hineinzubekommen: Berechtigungen, Exporte, Formate, das Jahrzehnt an Material, das kein Modell je gesehen hat. Nvidias Engpass ist, was zur Laufzeit rund um das Modell passiert: Werkzeuge, Gedächtnis, Rückmeldung, Überwachung. Das sind nicht dieselben Aussagen. Sie könnten das eine lösen und beim anderen weiterhin feststecken.

Gemeinsam ist ihnen die Form. Beides ist Installation. Beides ist unglamourös, unsichtbar wenn es funktioniert, und in keiner Produktvorstellung zu finden. Und beides ist nach dieser Beweislage entscheidender als die Zahl der Parameter, über die alle streiten.

Warum das aus unserer Sicht persönliche KI stärker trifft

Dieser nächste Teil ist unser Argument, nicht Nvidias. Sie haben Agenten an Rätseln getestet und über persönliche Assistenten überhaupt nichts gesagt. Aber die Logik überträgt sich, und sie überträgt sich eher mit mehr Wucht als mit weniger.

Ein allgemeines Modell, das eine allgemeine Frage beantwortet, kann sich auf das stützen, was es aus dem Internet aufgenommen hat. Es hat über die meisten Dinge sehr viel gelesen. Aber nirgendwo im Internet steht, was Sie Ihrem Bruder im Februar versprochen haben, oder dass die Person, die Ihnen heute schreibt, jene ist, die Sie vor vier Jahren auf einer Konferenz getroffen haben. Keine Menge an Parametern holt eine Tatsache zurück, die dem Modell nie gegeben wurde. Für einen persönlichen Assistenten ist das Gerüst keine Optimierung obenauf der Intelligenz. Es ist der Teil, der den Gegenstand überhaupt liefert.

Das heißt, die beiden Engpässe verstärken sich. Das Harness kann nur mit dem Kontext arbeiten, den es erreicht, und der Kontext ist nur erreichbar, wenn zuvor jemand die unglamouröse Arbeit getan hat, ihn aus Mail, Nachrichten und WhatsApp herauszuholen. Lösen Sie das zweite ohne das erste, und Sie haben ein hervorragendes Reasoning-System ohne irgendetwas Persönliches, worüber es nachdenken könnte.

Was wir nicht behaupten werden

ARC-AGI-3 ist ein Rätsel-Benchmark. Von 30 % auf 100 % bei abstrakten Reasoning-Gittern zu kommen, ist ein echtes Ergebnis über Agenten-Gerüste, und es ist kein Ergebnis darüber, zusammenzufassen, was im letzten Jahr mit Ihrer Schwester war. Niemand hat diese Übertragung gezeigt, wir eingeschlossen, und wir werden die Zahl nicht zitieren, als wäre sie unsere.

Nvidia hat außerdem ein offenkundiges wirtschaftliches Interesse an der Schlussfolgerung, dass man mehr in Gerüste und in die Rechenleistung investieren sollte, um sie zu betreiben. Das macht den Befund nicht falsch. Es heißt aber, dass man ihn so lesen sollte, wie man jede Untersuchung liest, die von einer Partei veröffentlicht wird, der es nützt, sie zu glauben.

Und ein Harness, das sich mit einem zweiten Agenten selbst überwacht, kostet Tokens und Laufzeit. Auf einem Mac, der ein Modell betreibt, ist dieses Budget auf eine Weise real, wie es im Rechenzentrum nicht ist. Einiges, was Nvidia sich leisten kann, können wir nicht, und wir sagen das lieber, als anzudeuten, unser Gerüst sei messbar besser als irgendeines. Es ist überhaupt nicht gemessen. Daran dürfen Sie uns später erinnern.

Der Teil, der nicht davon abhängt, wer recht hat

Es gibt hier eine strategische Lesart, die überlebt, welcher Engpass sich am Ende auch als dominant erweist.

Wenn nicht das Modell über Qualität entscheidet, dann ist das Modell der austauschbarste Teil des Systems. Das lohnt sich zu bedenken, denn es ist dieselbe Schlussfolgerung, zu der wir vergangene Woche von der Lieferkettenseite aus gekommen sind, auf einem völlig anderen Weg. Wenn die Gewichte eine Datei auf Ihrer Festplatte sind und diese Datei ersetzbar ist, dann ist die Schicht, um deren Verlust sich alle sorgen, jene, die am wenigsten zählt.

Die Teile, die wirklich schwer zu ersetzen sind, fotografiert niemand: die Berechtigungsarbeit, die Parser, die Identitätsauflösung, der Graph, der Abruf, das, was bemerkt. Das ist das meiste von dem, was wir gebaut haben, und lange war schwer zu erklären, warum es so lange gedauert hat, denn Installationsarbeit lässt sich nicht vorführen.

Diese Woche ist es ein wenig leichter zu erklären.