Offene Forschungsaufträge klingen oft klarer, als sie sind. Ein Agent soll einen Markt untersuchen, technische Optionen vergleichen oder eine Datenanalyse durchführen. Im Auftrag fehlen jedoch häufig die erwarteten Methoden, Belege und Erfolgskriterien. Das Ergebnis kann sprachlich überzeugend wirken und trotzdem eine wichtige Analyse auslassen. AutoSciRub setzt deshalb vor der eigentlichen Ausführung an: Das Framework erzeugt zuerst eine aufgabenspezifische, ausführbare Rubrik.
Nach der Primärarbeit zerlegt AutoSciRub eine unterspezifizierte Aufgabe in atomare wissenschaftliche Ziele. Die Kriterien werden in relevanter Literatur und den für die Aufgabe sichtbaren Daten verankert. Während der Bearbeitung und Revision prüft das System jedes Kriterium einzeln, markiert fehlende Anforderungen und fokussiert Verbesserungen. Die Autoren berichten konsistente Verbesserungen über mehrere Backbone-Modelle, Agenten-Harnesses sowie die Benchmarks ResearchClawBench und AstaBench. Das sind Ergebnisse des Forschungsteams, keine unabhängige Garantie für Unternehmensprozesse.
Warum Erfolgskriterien vor der Ausführung entstehen müssen
In vielen Agenten-Workflows wird Qualität erst am Ende beurteilt. Dann ist schwer zu erkennen, ob ein schwaches Ergebnis durch fehlende Daten, eine ungeeignete Methode oder eine unklare Aufgabenstellung entstanden ist. Eine vorab erzeugte Rubrik macht diese Erwartungen explizit. Sie kann etwa verlangen, dass Quellen aktuell und nachvollziehbar sind, Annahmen getrennt ausgewiesen werden und jede Empfehlung auf ein konkretes Kriterium zurückgeführt wird.
Für Unternehmen ist das vor allem ein Steuerungsprinzip. Ein Agent erhält nicht nur ein Ziel, sondern eine prüfbare Definition von Erledigung. Dadurch werden Zwischenstände vergleichbar und Revisionen begrenzbar. Ableiten lässt sich auch ein Vorteil für Governance: Fachverantwortliche können einzelne Kriterien freigeben oder zurückweisen, bevor teure Analysen und Experimente beginnen. AutoSciRub belegt allerdings nicht automatisch, dass jede erzeugte Rubrik fachlich richtig oder vollständig ist.
Checkliste für eine belastbare ausführbare Rubrik
Eine brauchbare Rubrik besteht nicht aus allgemeinen Wünschen wie „gründlich recherchieren“. Jedes Kriterium braucht einen beobachtbaren Nachweis und eine eindeutige Bewertung. Zugleich darf die Liste nicht so umfangreich werden, dass der Agent nur Kästchen erfüllt und die eigentliche Fragestellung aus dem Blick verliert.
- Das Geschäftsziel und die konkrete Entscheidung sind in einem Satz festgehalten.
- Jedes Teilziel ist einzeln prüfbar und überschneidet sich nicht unnötig mit anderen Kriterien.
- Zulässige Quellen, sichtbare Daten und zeitliche Grenzen sind festgelegt.
- Erwartete Methoden und notwendige Gegenprüfungen sind ausdrücklich benannt.
- Fakten, Annahmen und Ableitungen müssen getrennt ausgewiesen werden.
- Für jedes Kriterium ist definiert, welcher Beleg als bestanden gilt.
- Abbruchgründe wie fehlende Daten oder widersprüchliche Evidenz sind vorgegeben.
- Ein Fachverantwortlicher bestätigt die Rubrik, bevor der Agent mit der Ausführung beginnt.
Ein kontrollierter Pilot in vier Phasen
Phase eins wählt drei bis fünf bereits abgeschlossene Forschungsaufträge mit bekannten Stärken und Fehlern. Geeignet sind interne Technologievergleiche, strukturierte Marktanalysen oder die Auswertung nicht vertraulicher Datensätze. Für jede Aufgabe erstellt ein Fachexperte eine Referenzrubrik. Diese dient nicht als perfekte Musterlösung, sondern als unabhängiger Kontrollmaßstab.
Phase zwei lässt AutoSciRub seine Rubrik erzeugen, ohne die Referenzrubrik zu sehen. Das Team vergleicht beide auf Abdeckung, Prüfbarkeit, Quellenbezug und methodische Angemessenheit. Fehlende oder riskante Kriterien werden dokumentiert. Nur freigegebene Rubriken gehen in die Ausführung. So trennt der Pilot die Qualität der Auftragsdefinition von der Qualität des späteren Forschungsergebnisses.
Phase drei führt die Aufgaben mit und ohne Rubrik unter möglichst gleichen Bedingungen aus. Gemessen werden nicht nur Endbewertungen, sondern auch fehlende Kriterien, unbelegte Aussagen, Revisionsschleifen, Laufzeit und manuelle Prüfzeit. Ein unverändertes Kontrollset verhindert, dass der Pilot nur Beispiele auswählt, die zum Ansatz passen. Die berichteten Benchmarkverbesserungen liefern eine Hypothese; die Entscheidung muss auf eigenen Prozessdaten beruhen.
Phase vier begrenzt die Revision. Der Agent darf ausschließlich an den nicht erfüllten Kriterien arbeiten und muss neue Belege kenntlich machen. Ein festes Budget für Zeit, Toolaufrufe oder Versuche verhindert Endlosschleifen. Freigegeben wird ein Ergebnis nur, wenn alle zwingenden Kriterien bestanden sind und ein menschlicher Reviewer die geschäftlich relevanten Schlussfolgerungen bestätigt.
Kosten, Risiken und Betriebsmodell
Der zusätzliche Rubrikschritt verursacht zunächst Aufwand: Literatur muss gefunden, Kriterien müssen geprüft und Einzelbewertungen gespeichert werden. Wirtschaftlich wird der Ansatz nur, wenn diese Mehrkosten durch weniger Fehlversuche, zielgerichtete Revisionen oder geringere Review-Zeit ausgeglichen werden. Deshalb sollte der Pilot Kosten pro akzeptiertem Ergebnis messen, nicht nur Tokens oder Laufzeit eines einzelnen Agentenlaufs.
Operativ braucht jede Rubrik eine Version, einen Eigentümer und eine Verbindung zur ursprünglichen Aufgabe. Änderungen während der Ausführung müssen nachvollziehbar bleiben. Besonders kritisch sind automatisch hergeleitete Kriterien in regulierten oder wissenschaftlich anspruchsvollen Bereichen: Sie können eine falsche Sicherheit erzeugen, wenn ihre Quellenbasis ungeprüft bleibt. Für sensible Entscheidungen ist AutoSciRub daher ein Kontrollinstrument, kein Ersatz für Fachverantwortung.
Bestätigt ist ein Evaluation-first-Framework, das Ziele atomisiert, Kriterien in Literatur und sichtbaren Daten verankert und Revisionen anhand einzelner Anforderungen steuert. Plausibel ableiten lässt sich ein Nutzen für prüfbare Forschungsaufträge und begrenzte Nacharbeit. Ob der Ansatz im eigenen Unternehmen bessere Entscheidungen zu vertretbaren Kosten liefert, muss ein kontrollierter Pilot mit festem Kontrollset zeigen.