Wenn das Auto in der Simulation fahren lernt — mit Prof. Andreas Look

Wenn das Auto in der Simulation fahren lernt

Das Reißverschlussverfahren hat ihnen niemand gezeigt.

Ein Forschungsteam von Apple hat sehr viele Fahrzeuge gleichzeitig in einer Simulation fahren lassen. Jedes ein eigenes neuronales Netz, jedes mit einem Ziel, keines mit einem menschlichen Vorbild. Nach genügend Training fädelten sie an Engstellen abwechselnd ein, wendeten in drei Zügen und brachen einen Überholvorgang ab, wenn Gegenverkehr auftauchte.

Solche Manöver stehen in keinem Regelwerk, das man einem System einprogrammiert. Sie sind entstanden, weil sie ans Ziel führen.

In der neuen Folge von Autonomobil spreche ich mit jemandem, der aus beiden Welten kommt: aus der Entwicklung autonomer Fahrfunktionen und aus der Forschung zum maschinellen Lernen.

Wer Andreas Look ist

Andreas Look hat mehrere Jahre bei Bosch an autonomen Fahrfunktionen gearbeitet und forscht heute als Professor zu maschinellem Lernen. Vor wenigen Wochen hat er einen Workshop auf der Europäischen Computer-Vision-Konferenz ECCV mitorganisiert.

Seine Perspektive ist die des Entwicklers, der weiß, wie ein Nachweis von innen aussieht. Genau deshalb wird das Gespräch an der Stelle unbequem, an der die beiden Welten aufeinandertreffen: Was macht es mit einer Prüfung, wenn das System in genau der Umgebung fahren lernt, in der es später geprüft werden soll?

Drei Punkte aus dem Gespräch.

1. Die Simulation wechselt die Rolle

Bisher entstand Fahrverhalten überwiegend aus aufgezeichneten Fahrten. Das System lernt, sich zu verhalten wie ein Mensch in derselben Lage. Die Simulation kam danach: Szenarien nachspielen, Varianten durchrechnen, absichern.

Beim sogenannten Self-Play ist die Simulation der Ort, an dem das System fahren lernt. Belohnt wird, was ans Ziel führt, ohne Kollision und innerhalb der Regeln, die in die Belohnung geschrieben werden.

Lernen in der Simulation ist nicht neu. Neu ist, dass es in dieser Größenordnung funktioniert und in etablierten Vergleichstests vorn landet, ganz ohne menschliche Fahrdaten.

Dazu kommt ein Unterschied, der in der Prüfung noch wichtig wird: Beim Nachspielen einer Aufzeichnung reagieren die anderen Verkehrsteilnehmer nicht auf das eigene Fahrzeug. Beim Self-Play reagieren sie, weil sie selbst lernende Fahrzeuge sind.

2. Ein fester Prüfkatalog wird zum Trainingsmaterial

Ich habe Andreas gefragt, was passiert, wenn das KBA den Nachweis bestimmter Szenarien verlangt. Seine Antwort: Wer weiß, was gefragt wird, kann sehr genau darauf trainieren.

Damit prüft ein fester Katalog irgendwann nicht mehr, ob ein System fahren kann, sondern ob es den Katalog gesehen hat. Und was geprüft wird, spricht sich in einer überschaubaren Branche herum.

In den Gremien ist der Gedanke bekannt. Anforderungen werden bewusst allgemein formuliert, damit niemand auf einzelne Situationen hin optimiert. Self-Play verschärft das Problem, weil das Optimieren auf Szenarien hier der Entwicklungsprozess selbst ist.

Andreas' Gegenvorschlag: Die Prüforganisation stellt selbst eine Simulationsumgebung bereit, etwa mit Verkehrssituationen aus einer deutschen Großstadt. Hersteller reichen ihren Code ein, und welche Szenarien geprüft werden, bleibt verdeckt. In der Forschung ist dieses Prinzip unter dem Namen „Secret Leaderboard“ üblich.

3. Was ein Prüfer von einer Simulation überhaupt sehen kann

Simulationscode ist so komplex, dass selbst die Entwickler, die ihn geschrieben haben, Jahre später noch Fehler darin finden. Wer Ergebnisse wirklich nachprüfen will, braucht Zugriff auf den Quellcode und ein Team, das dem entspricht, das ihn gebaut hat.

Seine Schlussfolgerung ist deutlich: Eine Prüforganisation habe „keine Möglichkeit, das wirklich zu verifizieren“.

Dazu kommen die Fragen, die bei jedem Simulationsergebnis auftauchen. Was zählt als Kollision? Sind Trainings- und Testdaten sauber getrennt? Wurde auf genau diese Szenarien trainiert? Andreas unterstellt niemandem Absicht. Fehler passieren schlicht leicht.

Deshalb hält er den realen Test in der Genehmigung weiterhin für sinnvoll. Für die Entwicklung verliert er an Gewicht, für die Prüfung behält er es: Dort sieht ein Außenstehender mit eigenen Augen, was das Fahrzeug tut.

Was das für die Genehmigungsseite bedeutet

Die Durchführungsverordnung (EU) 2022/1426 regelt für die Typgenehmigung automatisierter Fahrsysteme unter anderem die Glaubwürdigkeitsbewertung virtueller Werkzeugketten. Der Hersteller muss nachweisen, wofür sein Simulationswerkzeug gilt und wie die Werkzeugkette validiert wurde.

Die Beweislast liegt also beim Hersteller. Was die Verordnung nicht beantwortet: Was heißt Validierung einer Werkzeugkette, wenn diese Kette das Verhalten des Systems nicht nur prüft, sondern hervorgebracht hat?

Das ist meine Lesart. Eine geklärte Auslegung dazu gibt es nicht.

Fazit

Die Ergebnisse stammen aus einer vereinfachten Welt: zweidimensional, von oben betrachtet, alle Verkehrsteilnehmer als Boxen. Was Weltwissen erfordert, fehlt dort vollständig. Ist das eine Pfütze oder Hochwasser? Läuft der Mensch auf dem Plakat oder auf dem Gehweg? Was will der Verkehrspolizist mit seiner Handbewegung?

Für diese seltenen Fälle braucht es weiterhin reale Daten. Deutlich weniger als bisher, aber nicht null.

Trotzdem verschiebt sich etwas. Wenn ein brauchbarer Planer auf einem einzelnen Rechenknoten entsteht statt aus einer Flotte von Fahrzeugen, dann schrumpft der Vorsprung derer, die diese Flotte haben. Und die Frage, wie man so ein System prüft, ist noch nicht beantwortet.

Weiter
Weiter

Ethik, KI und das Märchen vom Trolley-Problem