Im August haben wir gemessen, ob die Spracherkennung auf dem Telefon selbst laufen kann. Das Ergebnis war eindeutig: nein. Wir haben die Zahlen aufgeschrieben, die Entscheidung begründet und die Erkennung in die Cloud gelegt.
Die Messung war richtig. Der Schluss war falsch. Wir hatten die falsche Frage gestellt — und die Antwort lag die ganze Zeit auf dem Gerät.
Was wir gemessen hatten
Die Anordnung: Testgerät war ein Nokia 7.2 — Snapdragon 660, Baujahr 2019, Android 11. Bewusst ein Mittelklassegerät von vor Jahren: Trägt es dort, trägt es überall. Gemessen wurde am 21. und 25. August 2026.
Wir hatten Whisper in die App gepackt — das offene Modell von OpenAI, in der Größe „small“, 190 MB. Die Qualität war gut: Mit dem Wortschatz erkannte es „L-Alanin“ und „L-Carnitin“ genauso zuverlässig wie die Cloud. Das kleinere Modell „base“ dagegen machte den einen Fehler, der im Tagebuch einer Gesundheits-App nichts zu suchen hat:
Gesprochen: „ein halbes Gramm“ — erkannt: „½ kg“.
Einen falschen Namen sieht man. Einen falschen Faktor 1000 sieht man nicht — jedenfalls nicht morgens, nicht in Eile.
An der Geschwindigkeit war dann Schluss. „Small“ brauchte auf einem Snapdragon 660 rund 30 Sekunden je Äußerung, fast unabhängig von deren Länge, weil Whisper intern in Fenstern von 30 Sekunden rechnet. Dieselbe Datei über die Cloud: 1,4 Sekunden. Der Nutzer, der es ausprobiert hat, sagte es kürzer:
„So schlecht, dass man quasi schneller tippen kann, als auf die Übersetzung zu warten.“
Dazu 190 MB in jedem Download. Das Verzeichnis mit den mitgelieferten Dateien schrumpfte nach dem Ausbau von 182 MB auf 968 KB.
Der Denkfehler
Alle diese Zahlen stimmen weiterhin. Sie beantworten nur eine engere Frage als die, die wir gestellt zu haben glaubten.
Gemessen hatten wir: Kann ein Modell, das wir selbst mitliefern, auf einem Mittelklasse-Android schnell genug rechnen? Verstanden hatten wir es als: Kann ein Telefon Spracherkennung?
Das ist nicht dieselbe Frage. Jedes moderne Telefon kann Spracherkennung — es tut es jeden Tag, wenn jemand auf der Tastatur das Mikrofon antippt. Diese Erkennung ist Teil des Betriebssystems, sie ist auf die Hardware des Geräts abgestimmt, sie ist schon installiert, und sie kostet nichts. Wir hatten daneben ein eigenes Modell aufgebaut und gegen die Cloud gemessen statt gegen das, was schon da war.
Der alte Artikel hat sogar aufgeschrieben, wann wir neu messen würden. Einer der drei Auslöser lautete wörtlich: „oder die Betriebssysteme bringen eine Erkennung mit“. Sie brachten sie mit. Wir hatten nur nicht nachgesehen.
Was uns zum Nachsehen gezwungen hat
Nicht Neugier, sondern ein Brief. Wir hatten beim Erkennungsdienst schriftlich angefragt, ob er Gesundheitsdaten nach Artikel 9 DSGVO tragen darf. Die Antwort war nein — die Zertifizierung des Anbieters gilt für Server, Speicher und Netzwerk, nicht für den Erkennungsdienst. Bei einem zweiten Anbieter dasselbe.
Ein dritter Anbieter wäre der naheliegende nächste Schritt gewesen. Stattdessen haben wir die Frage von vorn gestellt — und die Antwort lag im Betriebssystem.
Wie es jetzt läuft
Die App benutzt die Erkennung des Betriebssystems und besteht ausdrücklich darauf, dass sie auf dem Gerät arbeitet: auf iPhones Apples Speech-Framework, auf Android der On-Device-Erkenner. Sie startet nur, wenn das System bestätigt, dass es die eingestellte Sprache ohne Netz versteht.
Drei Dinge sind dadurch besser geworden, und zwar ohne Gegenrechnung:
- Die Aufnahme verlässt das Telefon nicht mehr. Kein Dienstleister, kein Vertrag, keine Übermittlung, keine Einwilligung.
- Der Text steht da, während du sprichst. Die Erkennung liefert laufend Zwischenergebnisse statt einer Antwort am Ende — die Karten entstehen schon beim Reden.
- Kein Modell im Paket. Die 190 MB kommen nicht zurück.
Eine neue Stoppuhr-Messung wie im August gibt es noch nicht, und wir erfinden keine. Was man ohne Stoppuhr sieht: Es wird nicht auf eine Antwort gewartet, weil es keine Antwort gibt, auf die man warten könnte.
Was es kostet
Der ehrliche Teil, und er ist diesmal kürzer als beim letzten Mal, aber er ist da.
Nicht jedes Telefon kann es. Auf iPhones ist die Erkennung seit Jahren an Bord. Auf Android braucht es Version 13 oder neuer und ein installiertes Sprachpaket für die Erkennung ohne Netz. Fehlt beides, gibt es in RecTake keine Spracherkennung — dann tippt man. Das Nokia 7.2, auf dem im August gemessen wurde, gehört selbst dazu.
Einen stillen Rückfall auf einen Server bauen wir dafür nicht ein. Eine App, die im Zweifel doch überträgt und es nicht sagt, ist schlimmer als eine, die eine Funktion nicht hat.
Und wir haben weniger Stellschrauben. Beim eigenen Modell konnte man die Größe wählen, den Prompt bauen, die Parameter drehen. Beim Erkenner des Betriebssystems gibt es genau einen Hebel: den Wortschatz, den die App als Kontext mitgibt. Er entscheidet, ob aus „Elalanin“ ein „L-Alanin“ wird. Der ist damit wichtiger geworden, nicht unwichtiger.
Was wir daraus mitnehmen
Die Messung im August war sauber, das Gerät war bewusst schlecht gewählt, die Zahlen waren echt. Der Fehler saß eine Ebene darüber: in der Annahme, dass „auf dem Telefon“ und „unser Modell auf dem Telefon“ dasselbe sind.
Wir lassen den alten Text deshalb nicht einfach verschwinden, sondern schreiben auf, was daran falsch war. Wohin die Aufnahme heute geht, steht in einem eigenen Artikel: Wohin deine Sprachaufnahme geht — die Antwort ist inzwischen ein Wort lang.