Diktieren unter Windows – offline, direkt in jedes Programm
Du denkst schneller, als du tippen kannst. Hotkey drücken, sprechen, nochmal drücken — der Text landet dort, wo dein Cursor steht: in Outlook, Word, im Browser, im Chat. Die Spracherkennung läuft mit Whisper oder Parakeet auf deinem Rechner. Weder Aufnahme noch Text werden hochgeladen.
Kein Konto nötig · Kostenlos in deiner Systemsprache
Läuft ab Windows 10 · Keine Adminrechte nötig · Kein Konto
Tippen ist der Flaschenhals
Du weißt genau, was in der Mail stehen soll. Du brauchst nur zwölf Minuten, um es zu tippen.
Diktier-Apps gibt es. Nur haben die meisten drei Haken: Sie schicken deine Stimme an einen Server, sie kosten monatlich, und sie sind eine eigene Anwendung — du diktierst dort hinein, kopierst den Text und fügst ihn woanders wieder ein.
Celerando hat kein eigenes Fenster zum Reinsprechen. Der Text erscheint direkt in dem Programm, in dem du gerade arbeitest.
Drei Schritte, kein vierter
Überall in Windows, egal welches Programm gerade vorn ist.
Ganz normal. Keine Kommandos, keine Pausen an bestimmten Stellen.
Der Text steht da, wo dein Cursor war. Kein Kopieren, kein Einfügen, kein Fensterwechsel. Lieber halten und loslassen? Ab Business geht auch Push-to-Talk.
Zwei Engines, 99 Sprachen — alles auf deinem PC
Celerando erkennt Sprache mit zwei quelloffenen Engines. Beide laufen lokal, beide lädt die App direkt von Hugging Face:
99 Sprachen, fünf Modellgrößen von Tiny (75 MB) bis Large v3 Turbo (1,6 GB). Läuft auf der CPU, mit NVIDIA-Karte per CUDA, mit jeder anderen Grafikkarte per Vulkan. Die Engine aller Editionen.
25 europäische Sprachen mit automatischer Spracherkennung, sehr niedrige Latenz, streaming-tauglich. Läuft auf jeder DirectX-12-Grafikkarte — AMD, Intel oder NVIDIA. Ab Business.
Kostenlos: deine Systemsprache mit Whisper Base. Ab Pro: alle 99 Whisper-Sprachen, freie Modellwahl, GPU-Beschleunigung. Ab Business: automatische Spracherkennung und Parakeet.
- Deutsch
- Englisch
- Spanisch
- Französisch
- Italienisch
- Portugiesisch
- Niederländisch
- Polnisch
- Tschechisch
- Dänisch
- Schwedisch
- Norwegisch
- Finnisch
- Ungarisch
- Rumänisch
- Griechisch
- Türkisch
- Russisch
- Ukrainisch
- Arabisch
- Hebräisch
- Hindi
- Chinesisch
- Japanisch
- Koreanisch
- Vietnamesisch
- Thai
- Indonesisch
… und 71 weitere. Die Sprache wird pro Diktat eingestellt oder — ab Business — automatisch erkannt.
Die Modelle: einmal laden, dann offline
Die Modelle werden einmalig innerhalb der App heruntergeladen und liegen danach in deinem Benutzerprofil — ohne Adminrechte. Whisper Base ist der Standard und wird beim Aktivieren der Spracheingabe nachgeladen; alle anderen wählst du in den Einstellungen.
Danach braucht die Spracherkennung keine Verbindung mehr. Zug, Flugzeug, Keller, abgeschottetes Firmennetz — das Diktat läuft weiter.
| Modell | Download | Wofür |
|---|---|---|
| Whisper Tiny | 75 MB | Sehr schnelle Notizen, geringste Genauigkeit |
| Whisper Base (Standard) | 141 MB | Solider Allrounder, läuft auf jedem PC ohne Grafikkarte |
| Whisper Small | 466 MB | Gute Genauigkeit, noch CPU-tauglich |
| Whisper Medium / Medium q5 | 1,5 GB / 539 MB | Hohe Genauigkeit, GPU empfohlen — q5 ist die Variante für Rechner mit 8 GB RAM |
| Whisper Large v3 Turbo / Turbo q5 | 1,6 GB / 574 MB | Beste Genauigkeit, GPU dringend empfohlen |
| Parakeet TDT 0.6B v3 | 2,5 GB | Niedrigste Latenz, 25 Sprachen automatisch erkannt — ab Business |
Die optionale CUDA-Laufzeit für NVIDIA-Karten (rund 70 MB) kommt von downloads.menterium.net, sobald du sie in den Einstellungen wählst. Ohne sie nutzt Celerando Vulkan — kein Fehler, nur ein anderer Weg auf dieselbe Grafikkarte.
Läuft das auf deinem Rechner?
Drei Stufen, vom Bürorechner bis zur Workstation — und keine davon braucht zwingend eine Grafikkarte:
Windows 10 (Build 19041) oder Windows 11, 4 GB RAM, jede x86-64-CPU. Whisper Tiny und Base laufen rein auf der CPU — auch auf einem älteren Notebook.
CPU mit AVX2 (Intel ab 2013, AMD ab 2015), 8 GB RAM, DirectX-12-Grafik von Intel, AMD oder NVIDIA. Alltagsdiktat mit Small oder Medium q5; Parakeet läuft hier bereits.
16 GB RAM, NVIDIA-Karte ab 4 GB Grafikspeicher (CUDA) oder eine moderne GPU ab 6 GB. Large v3 Turbo, lange Diktate, Smart Modes.
Die Seite Spracheingabe – Voraussetzungen hat einen Self-Check: drei Klicks, und du weißt, welche Engine und welches Modell zu deiner Maschine passen.
„Menterium“ ist kein Wort. Für Celerando schon.
Jede Spracherkennung scheitert an denselben Dingen: Eigennamen, Firmennamen, Produktnamen, Fachbegriffe aus deinem Beruf. Du diktierst deinen eigenen Nachnamen und bekommst etwas zurück, das nur so ähnlich klingt.
Im Personal Dictionary trägst du diese Wörter einmal ein — samt der Varianten, die die Erkennung fälschlich produziert. Ab dann sitzt es.
Das wirkt in beide Richtungen: Die Begriffe werden der Erkennung schon vor der Transkription mitgegeben, und falsche Schreibweisen werden danach korrigiert.
Enthalten ab Pro.
Vom Diktat zum fertigen Text
Nach der Erkennung läuft der Text durch drei Stufen, alle lokal, alle abschaltbar:
Gesprochene Zeichen werden zu Symbolen („Euro“ → €), Abkürzungen ausgeschrieben oder gekürzt, eigene Ersetzungen per regulärem Ausdruck. Ab Pro.
Ein lokales Sprachmodell räumt auf: Füllwörter raus, Interpunktion rein, Ton abmildern oder als E-Mail formulieren. Braucht in der Regel eine DirectX-12-Grafikkarte mit genug Grafikspeicher. Ab Business.
Der Text erscheint schon, während du sprichst — Stück für Stück, direkt im Zielprogramm. Ab Business, ebenso wie Push-to-Talk; beides lässt sich unabhängig voneinander einschalten.
Deine Stimme verlässt deinen Rechner nicht
Cloud-Diktat bedeutet: Deine Aufnahme wird auf einen fremden Server übertragen, dort verarbeitet und der Text zurückgeschickt.
Wer Mandantengespräche, Patientendaten, Personalakten oder Vertragsentwürfe diktiert, hat es mit Berufsgeheimnissen und der DSGVO zu tun. Ein Cloud-Dienst ist dann oft nicht freigabefähig.
Celerando verarbeitet Aufnahme und Text auf deinem PC. Was die App überhaupt kontaktiert: den Download jedes Modells, das du wählst, die Update-Prüfung, beim allerersten Start einen einmaligen Installations-Ping und — nur wenn du sie in den Einstellungen wählst — die optionale CUDA-Laufzeit. Der enthält eine zufällige Installations-ID, einen gekürzten Hash der Geräte-Kennung sowie App- und Windows-Version — kein Konto, kein Name, keine Inhalte. Der Server speichert die IP-Adresse nicht im Klartext: Ein Hash davon wird nach 48 Stunden gelöscht, die daraus abgeleitete ungefähre Herkunft (Land, Region, Stadt mit Genauigkeitsradius) bleibt mit dem Eintrag 24 Monate erhalten. Audio und Text sind nie Teil davon. Das lässt sich mit jedem Netzwerk-Monitor nachprüfen.
Der optionale Transkriptions-Verlauf (ab Pro) speichert Text und Aufnahme ausschließlich in deinem Benutzerprofil — standardmäßig aus.
Celerando und die Windows-Spracheingabe im Vergleich
Windows bringt mit Win + H eine eigene Spracheingabe mit. Der Unterschied liegt nicht darin, ob sie funktioniert — sondern wo.
| Celerando | Windows-Spracheingabe (Win + H) | Cloud-Diktier-Apps | |
|---|---|---|---|
| Wo erkannt wird | Auf deinem PC | Auf Microsoft-Servern (Online-Spracherkennung) | Auf den Servern des Anbieters |
| Internet nötig | Nie beim Diktieren — nur Downloads, Updates und der Erst-Start-Ping | Bei jedem Diktat | Bei jedem Diktat |
| Engine | Whisper oder Parakeet, Modell ab Pro frei wählbar | Microsoft, nicht wählbar | Proprietär |
| Sprachen | 99 (Whisper, alle ab Pro), 25 automatisch (Parakeet, ab Business) | Je nach installiertem Sprachpaket | Je nach Dienst |
| Eigene Begriffe | Personal Dictionary, Regeln, Smart Modes | — | Je nach Dienst |
| Preis | Kostenlos (Systemsprache), Pro 29,99 € einmalig | In Windows enthalten | Meist 7–15 € im Monat |
Stand September 2026. Die Windows-Spracheingabe ist für gelegentliche Notizen völlig in Ordnung — die Frage ist nur, ob dein Diktat auf einen fremden Server darf.
Wenn Tippen keine Option ist
Sehnenscheidenentzündung, RSI, Tendinitis. Diktieren ist dann kein Komfort, sondern die Voraussetzung dafür, weiterarbeiten zu können.
Sprechen fällt fast immer leichter als schreiben.
Mails, Protokolle, Dokumentation, Notizen.
Einmal zahlen. Nicht monatlich.
Vergleichbare Diktier-Werkzeuge kosten 7–15 € im Monat. Nach einem Jahr bist du bei über 100 €, und die Rechnung hört nicht auf.
Celerando Pro kostet 29,99 € einmalig. Updates innerhalb der Version sind eingeschlossen.
Häufige Fragen zum Offline-Diktieren
Funktioniert das Diktieren ohne Internet?
Ja, vollständig. Das Sprachmodell wird einmal innerhalb der App heruntergeladen — Whisper Base mit 141 MB ist der Standard, das größte Whisper-Modell hat 1,6 GB und Parakeet 2,5 GB — und liegt danach in deinem Benutzerprofil. Die Erkennung selbst baut keine Verbindung auf; du kannst das im Flugmodus ausprobieren.
Welche Sprachen werden erkannt?
Mit Whisper 99 Sprachen — darunter Deutsch, Englisch, Spanisch, Französisch, Italienisch, Portugiesisch, Niederländisch, Polnisch, Türkisch, Russisch, Ukrainisch, Arabisch, Chinesisch, Japanisch und Koreanisch. Kostenlos ist deine Systemsprache, ab Pro alle 99. Ab Business erkennt Celerando die Sprache automatisch, und Parakeet bringt 25 europäische Sprachen mit sehr niedriger Latenz.
Whisper oder Parakeet — welche Engine soll ich nehmen?
Whisper ist der Standard: die meisten Sprachen, die größte Modellauswahl, auf NVIDIA-Karten per CUDA beschleunigt. Parakeet lohnt sich, wenn du eine AMD- oder Intel-Grafikkarte hast oder die geringste Verzögerung willst — 25 europäische Sprachen mit automatischer Erkennung, streaming-tauglich. Parakeet ist ab Business enthalten.
Wie groß ist der Download, und wo liegen die Modelle?
Whisper reicht von 75 MB (Tiny) bis 1,6 GB (Large v3 Turbo), Parakeet belegt 2,5 GB, und die optionale CUDA-Laufzeit kommt mit rund 70 MB dazu. Die Modelle kommen direkt von Hugging Face und liegen in deinem Windows-Benutzerprofil unter %LOCALAPPDATA%\Menterium\Celerando — ohne Adminrechte, und sie lassen sich in der App wieder löschen.
Brauche ich eine Grafikkarte?
Nein. Whisper Tiny, Base und Small laufen auf der CPU, auch auf einem älteren Bürorechner. Eine Grafikkarte macht größere Modelle praktikabel: NVIDIA per CUDA, alle anderen per Vulkan; Parakeet nutzt jede DirectX-12-Karte. GPU-Beschleunigung ist ab Pro enthalten. Wählst du CUDA ohne installierte Laufzeit, fällt Celerando auf Vulkan zurück — kein Fehler, kein Abbruch.
Wird meine Stimme irgendwo gespeichert?
Nicht außerhalb deines Rechners. Der optionale Transkriptions-Verlauf (ab Pro) speichert Text und Aufnahme in deinem Benutzerprofil, damit ein Diktat nicht verloren ist, wenn es im falschen Fenster landet — er ist standardmäßig aus und lässt sich jederzeit leeren.
In welchen Programmen funktioniert das Diktieren?
In allen, die Texteingabe erlauben — Outlook, Word, Browser, Teams, Slack, Editoren, Eingabemasken. Celerando fügt den Text standardmäßig per Zwischenablage und Strg+V ein; für Remote-Desktop und Terminals gibt es einen Modus, der Zeichen für Zeichen tippt.
Wie lang darf eine Aufnahme sein?
In der kostenlosen Version 30 Sekunden pro Aufnahme. Ab Pro unbegrenzt.
Erscheint der Text schon während des Sprechens?
Das ist der Streaming-Modus, enthalten ab Business — der Text erscheint Stück für Stück, während du sprichst. In Free und Pro wird der Text eingefügt, sobald du die Aufnahme beendest.
Was sind Smart Modes?
Ein lokales Sprachmodell, das den erkannten Text nachbearbeitet — Füllwörter entfernen, Interpunktion setzen, den Ton abmildern, als E-Mail formulieren. Die Modelle (etwa Llama 3.2 3B oder Mistral 7B) laufen über DirectML auf einer DirectX-12-Grafikkarte mit genug Grafikspeicher; für Rechner ohne gibt es ein kleines CPU-Modell, das für Interpunktion und leichte Glättung reicht. Ab Business.
Ist das für Kanzleien, Praxen und Unternehmen mit Schweigepflicht geeignet?
Die Ausgangslage ist eine andere als bei einem Cloud-Dienst: Es gibt keinen Dritten, der Aufnahme oder Text verarbeitet, und damit auch keinen Auftragsverarbeiter, der vertraglich gebunden werden müsste. Ob das für deinen Fall genügt, entscheidet eure Datenschutzprüfung — diese Seite liefert die technischen Fakten dafür.
Brauche ich Adminrechte?
Nein. Celerando installiert sich in dein Benutzerprofil, die Modelle ebenfalls.