Was in einer Antwort steckt
Zwischen dem Moment, in dem die Person aufhört zu sprechen, und dem Moment, in dem die Stimme einsetzt, passieren drei Dinge nacheinander: Die Spracherkennung macht aus dem Audio Text, das Sprachmodell entscheidet, was geantwortet wird, und die Sprachsynthese macht aus der Antwort wieder Audio. Jeder Schritt braucht Zeit, und alle drei addieren sich.
Bei SARI antwortet diese ganze Kette in rund 600 ms, und in rund 160 ms, wenn die Frage schon im Antwortbestand liegt und nichts zu überlegen ist. Der Sitzungsaufbau bis zum ersten Ton dauert im Median 57 ms. Das sind Werte des Systems, am Server gemessen.
Warum 600 ms und nicht zwei Sekunden
In einem Gespräch zwischen Menschen wechselt der Sprecher innerhalb weniger hundert Millisekunden. Ab einer Sekunde fragt sich der Anrufer, ob er gehört wurde; bei zwei Sekunden wiederholt er den Satz oder legt auf. Deshalb zählt die Zahl in Millisekunden: Sie ist keine Marketingzahl, sondern die Schwelle, ab der sich das Gespräch nicht mehr wie eines anfühlt.
Sich unterbrechen lassen ist auch Latenz
Das nennt man Barge-in: Spricht die Person, während die Stimme antwortet, verstummt die Stimme und hört zu. Es wirkt wie ein Detail und ist das, was ein Gespräch von einem Anrufbeantworter unterscheidet. Über Lautsprecher braucht es dafür Echounterdrückung, sonst unterbricht sich die Stimme selbst, wenn sie sich über das Mikrofon hört.
Die öffentliche Demo misst das live: Die angezeigte Zeit läuft von dem Moment, in dem Sie aufhören zu sprechen, bis die ersten Samples der Antwort erklingen, inklusive Erkennung, Modell und Synthese.
Was das Netz je nach Standort hinzufügt
Die Werte des Systems werden am Server gemessen. Was der Besucher spürt, enthält zusätzlich die Netzlaufzeit zum Knoten: von Kolumbien nach Helsinki sind das ein paar Zehntelsekunden mehr, aus Europa fast nichts. Deshalb zeigt die Demo je nach Land eine andere Latenz, und deshalb wählt eine ernsthafte Installation die Jurisdiktion des Knotens auch nach der Nähe zum Anrufer.
Wenn ein Anbieter langsam ist
Erkennung, Modell und Synthese stammen von verschiedenen Anbietern, und jeder kann einen schlechten Moment haben. Bei SARI springt der Ersatz ein, wenn der primäre Anbieter länger als 450 ms braucht: Kein Teil ist ein Single Point of Failure. Das macht die Antwort im Schnitt nicht schneller; es sorgt dafür, dass der schlimmste Fall kein stummer Anruf ist.