Vorab: Was du wissen solltest

Alle Zahlen auf dieser Seite stammen von OpenAI selbst, aus der eigenen Ankündigung. Unabhängig nachgeprüft ist bisher wenig, und beim wichtigsten Wert – ARC-AGI-3 – hängt das Ergebnis stark davon ab, wie getestet wird: Je nach Prüfaufbau liegen die berichteten Werte zwischen rund 98,6 % und 99,9 %. Es gibt für diesen Benchmark keine einheitliche Konfiguration über verschiedene Systeme hinweg. „Bester Wert, den es je gab" heißt also nicht automatisch „direkt vergleichbar".

Wer es schon nutzen kann

Das ist der Punkt, der in vielen Meldungen untergeht: Angekündigt heißt nicht verfügbar.

  1. Zuerst ausgewählte Unternehmen Zum Start ging das Modell an eine begrenzte Zahl von Organisationen. Cybersecurity-Kunden aus OpenAIs Daybreak-Programm bekamen es zuerst.
  2. Danach die bezahlten ChatGPT-Pläne In den Tagen danach für Plus, Pro, Business und Enterprise.
  3. Und für Entwickler Über die OpenAI-API sowie über AWS Bedrock und Microsoft Azure.

Die Zahlen aus der Ankündigung

Alles Werte von OpenAI, gemessen auf dem eigenen Prüfstand.

Computer Use – neu ist das Level, nicht die Funktion

Dass ein Modell den Rechner selbst bedient – klicken, tippen, Programme steuern –, gibt es nicht erst seit gestern. Computer Use läuft seit einer Weile, war bisher aber eher ein Versprechen als ein Werkzeug. Neu ist, wie zuverlässig es jetzt funktioniert.

Das sieht man an OSWorld 2.0, dem Benchmark dafür: 72,6 % gegenüber 65,7 % beim Vorgänger, bei rund 40 statt 75 Minuten pro Aufgabe. Also kein Sprung in der Funktion, sondern in der Trefferquote und im Tempo – und genau daran entscheidet sich, ob man so etwas im Alltag einsetzt oder nicht.

Ehrlich eingeordnet

Originalquellen