Eine KI-Stimme ist heute schnell erzeugt. Der Unterschied zwischen „man hört, dass es KI ist“ und „das hätte auch ein Sprecher sein können“ entsteht erst danach: bei Aussprache, Betonung, Timing und Sound. Genau da kommen wir vom macjingle Tonstudio ins Spiel.
Ein KI-Voiceover ist eine Sprachaufnahme, die nicht im Studio eingesprochen, sondern von einer KI-Stimme erzeugt wird. Der Text wird an ein Sprachmodell übergeben, das ihn in eine natürlich klingende Stimme umsetzt – ohne Sprechertermin, ohne Studiobuchung, in jeder gewünschten Sprache.
Nicht jeder Text braucht eine KI-Stimme – und nicht jeder Text verträgt eine. Wo sie ihre Stärken ausspielt und wo wir dir eher zu einem Sprecher raten, siehst du hier.
Imagefilme und Unternehmensvideos – auch mehrsprachig für internationale Märkte
Erklärvideos und Produktvideos – häufige Skriptänderungen ohne neue Aufnahmetermine
E-Learning und Schulungsinhalte – große Textmengen zu planbaren Kosten
Telefonansagen und Ansagen im Wartefeld – schnell aktualisierbar
Audioguides und Museumsanwendungen – viele Sprachversionen desselben Textes
Einzelne Ansagen und kurze Spots – wenn es schnell gehen muss
Dein Text, unsere Stimmen
Skript schicken, Hörprobe und Angebot bekommen.
KI-Stimmen kann heute jeder erzeugen. Wir sind die, die hören, ob es gut ist. Bei uns sitzen Producer, die seit Jahrzehnten mit echten Sprecherinnen und Sprechern arbeiten – und deshalb sofort merken, wenn eine generierte Stimme danebenliegt. Wir generieren nicht einfach, wir kontrollieren: jede Spur in voller Länge, jeden Eigennamen, jede Betonung. Und wir bearbeiten sie anschließend so, wie bei uns jede Sprecheraufnahme bearbeitet wird. Am Ende steht keine Datei, sondern eine Sprachspur, hinter der wir stehen.
Vom Ausgangstext bis zur fertigen Sprachaufnahme sind es drei Schritte: Wir übersetzen deinen Text in die Zielsprache, suchen die passende Stimme aus und generieren daraus das fertige Voiceover. Du entscheidest, wo wir einsteigen.
Eine gute Übersetzung ist die halbe Vertonung. Ein Fehler im Text wird durch die Vertonung nicht kleiner – nur hörbarer. Wir bereiten deinen Referenztext KI-gestützt in der gewünschten Sprache auf und nehmen jede Übersetzung danach noch einmal selbst zur Hand.
In unserem Angebot enthalten:
Gut zu wissen:
Unsere Sichtprüfung ist eine formale Kontrolle, keine inhaltliche oder sprachliche Prüfung. KI-Übersetzungen sind inhaltlich sehr gut – ob Stil, Tonalität, Fachsprache und regionale Sprachvarianten passen, kann aber nur ein Muttersprachler beurteilen. Wir empfehlen dir für jede Sprache eine externe Native-Speaker-Prüfung vor der Vertonung.
Eine Stimme, die acht Sprachen spricht, klingt in sieben davon nach Gast. Wir arbeiten deshalb pro Sprache mit einer KI-Stimme, die auf genau diese Sprache trainiert ist. Der Unterschied fällt deinem Kunden im Zielgebiet sofort auf – auch wenn er ihn nicht benennen kann.
In unserem Angebot enthalten:
Gut zu wissen:
Für die meisten Projekte wirst du dieses Wahlmodul vermutlich nicht brauchen. Wenn du uns die Stimmenwahl überlässt, ist die Vorauswahl einer passenden Stimme bereits im Tarif für die KI-Sprachgenerierung enthalten. Das Voice-Casting buchst du nur dann dazu, wenn du selbst zwischen mehreren Stimmen entscheiden möchtest.
Jetzt kommt der Teil, den kein Online-Tool leistet. Text rein, Stimme raus – so weit kommt jeder in fünf Minuten. Nur klingt das Ergebnis dann auch danach.
Bei macjingle übernimmt an dieser Stelle ein erfahrener Tontechniker: Er generiert Abschnitt für Abschnitt, hört gegen, korrigiert nach und bearbeitet die fertige Spur wie jede andere Sprecheraufnahme im Haus.
In unserem Angebot enthalten:
Gut zu wissen:
Die Qualität der KI-Stimmen ist von Sprache zu Sprache unterschiedlich. Auch nach sorgfältiger Produktion können vereinzelt aussprachliche Unsauberkeiten bleiben – technologiebedingt und vor allem bei Sprachen mit komplexerer Aussprache. Ganz ausschließen lässt sich das auch im Studio nicht. Eine Native-Speaker-Prüfung ist hier nicht enthalten, wir empfehlen sie dir aber.
Nicht jede Sprache ist für eine KI gleich einfach. Deshalb arbeiten wir mit zwei Gruppen – der Unterschied liegt im Korrekturaufwand, nicht in der Qualität, die du bekommst.
Deutsch · Englisch · Italienisch · Französisch · Spanisch · Portugiesisch · Niederländisch · Polnisch
Hier sind die KI-Stimmen am weitesten entwickelt. Betonung und Aussprache sitzen meist schon nach wenigen Durchgängen.
Russisch · Türkisch · Ukrainisch · Kroatisch
weitere auf Anfrage
Die KI-Stimmen sind hier weniger ausgereift. Wir müssen deutlich öfter nachjustieren, bis jedes Wort korrekt klingt – das schlägt sich im Preis nieder.
Du zahlst nur die Module, die du brauchst. Abgerechnet wird nach Wortanzahl deines Referenztextes, nicht nach Videolänge – so weißt du den Preis, bevor wir anfangen.
| Referenztext | ca. Laufzeit | Preis pro Sprache |
|---|---|---|
| bis 500 Wörter | bis ca. 4 Minuten | € 45,– |
| bis 1.200 Wörter | bis ca. 10 Minuten | € 65,– |
| bis 2.500 Wörter | bis ca. 20 Minuten | € 95,– |
| je weitere 1.000 Wörter | ca. 8 Minuten | + € 28,– |
| Referenztext | ca. Laufzeit | Gruppe A | Gruppe B |
|---|---|---|---|
| bis 500 Wörter | bis ca. 4 Minuten | € 145,– | € 195,– |
| bis 1.200 Wörter | bis ca. 10 Minuten | € 240,– | € 320,– |
| bis 2.500 Wörter | bis ca. 20 Minuten | € 390,– | € 520,– |
| je weitere 1.000 Wörter | ca. 8 Minuten | + € 120,– | + € 160,– |
Alle Preise netto, zzgl. 20 % MwSt. Gruppe A: Standardsprachen wie Deutsch, Englisch, Italienisch, Französisch, Spanisch, Portugiesisch, Niederländisch und Polnisch. Gruppe B: Sprachen mit komplexerer Aussprache, wie Russisch, Türkisch, Ukrainisch oder Kroatisch – weitere auf Anfrage.
Mehrere Sprachen oder ein größeres Volumen?
Dann rechnen wir nicht stur nach Liste – sprich uns an, wir kalkulieren dein Projekt als Paket.
Schick uns dein Skript
wir sagen dir, was möglich ist.
Wir nutzen, was die Technik kann. Und wir sagen dir, wo sie an ihre Grenzen kommt.
Die Qualität der KI-Stimmen ist von Sprache zu Sprache unterschiedlich. Auch nach sorgfältiger Produktion können vereinzelt aussprachliche Unsauberkeiten bleiben – technologiebedingt und vor allem bei Sprachen mit komplexerer Aussprache. Ganz ausschließen lässt sich das auch im Studio nicht.
Eine Native-Speaker-Prüfung ist in unseren Tarifen nicht enthalten. Wir empfehlen sie dir aber für jede Sprache, in der du selbst nicht mitreden kannst – gerade bei Übersetzungen entscheidet der Muttersprachler darüber, ob Stil, Fachsprache und regionale Variante wirklich passen.
Im Zweifelsfall ist die echte menschliche Stimme immer noch die bessere Wahl.
Ein Muttersprachler, der den Text versteht, weiß, welches Wort betont gehört, wo eine Pause hingehört und wann Ironie mitschwingt. Diese Entscheidungen trifft eine KI nicht, sie ahmt sie nach. Wenn dein Projekt Emotion transportieren soll, wenn dein Markenauftritt an der Stimme hängt oder wenn du im Zielmarkt keinen zweiten Eindruck bekommst, dann nimm den echten Sprecher – bei uns bekommst du beides aus demselben Studio, und wir sagen dir ehrlich, was in deinem Fall sinnvoller ist.
Beides bekommst du bei uns aus demselben Studio. Welche Variante besser passt, hängt weniger vom Budget ab als davon, was deine Stimme leisten soll.
| KI-Voiceover | Sprecheraufnahme im Studio | |
|---|---|---|
| Tempo | Ergebnis meist innerhalb weniger Arbeitstage | abhängig von der Verfügbarkeit des Sprechers |
| Änderungen | jederzeit nachproduzierbar | neuer Aufnahmetermin nötig |
| Mehrsprachigkeit | viele Sprachen zu planbaren Kosten | pro Sprache ein Native Speaker |
| Emotion und Spiel | sachlich stark, emotional begrenzt | volle Bandbreite |
| Typische Einsätze | E-Learning, Erklärvideo, Imagefilm, Ansagen | Werbespot, Markenkommunikation, Charaktersprache |
Du bist unsicher, was für dein Projekt sinnvoller ist? Dann frag uns – wir sagen dir ehrlich, wenn eine echte Sprecheraufnahme das bessere Ergebnis bringt. Für fremdsprachige Projekte findest du bei uns auch erfahrene Native Speaker.
Bei macjingle startet ein KI-Voiceover bei € 145,– netto pro Sprache für Texte bis 500 Wörter, das entspricht rund 4 Minuten Laufzeit. Ein 20-minütiger Text kostet € 390,– netto pro Sprache. Übersetzungen und optionales Voice-Casting werden separat kalkuliert. Abgerechnet wird nach Wortanzahl, nicht nach Videolänge.
Bei sachlichen Texten in gängigen Sprachen meist nicht mehr. Entscheidend ist die Nachbearbeitung: Wir produzieren in Segmenten, hören jede Spur in voller Länge durch und korrigieren Betonung und Aussprache, bis es sitzt. Der Unterschied zwischen einem roh generierten und einem im Studio bearbeiteten Voiceover ist deutlich hörbar.
Ein einsprachiges Projekt liefern wir in der Regel innerhalb weniger Arbeitstage. Bei mehrsprachigen Projekten kommt die Zeit für Übersetzung und deine Freigabe dazu – wir stimmen den Zeitplan im Angebot mit dir ab.
Ja. Standardmäßig wählen zwar wir nach deinem Stimmprofil eine passende Stimme aus, das ist im Tarif enthalten. Wenn du selbst entscheiden möchtest, stellen wir dir pro Sprache drei Stimmen mit deinem eigenen Text gegenüber – als Voice-Casting um € 90,– netto pro Sprache.
Grundsätzlich in nahezu allen gängigen Weltsprachen. Die KI-Systeme, mit denen wir arbeiten, decken den europäischen Raum vollständig ab und reichen weit darüber hinaus. Unterschiedlich ist dabei nicht die Verfügbarkeit, sondern die Reife der Stimmen: In manchen Sprachen klingt das Ergebnis schon nach wenigen Durchgängen überzeugend, in anderen brauchen wir deutlich mehr Korrekturschleifen. Sag uns einfach, welche Sprachen du brauchst – wir prüfen vorab, was möglich ist, und sagen dir offen, wenn wir bei einer Sprache zu einer echten Sprecheraufnahme raten.
Du bekommst die fertige, sendefertig gemasterte Sprachspur im gewünschten Format – geschnitten, von Atem- und Störgeräuschen bereinigt, in Klang und Dynamik bearbeitet. Auf Wunsch inklusive Musikbett und finaler Mischung.
Für den vereinbarten Verwendungszweck ja, zeitlich und räumlich unbegrenzt. Eine Exklusivität an der Stimme selbst besteht nicht, da wir mit lizenzierten Stimmen aus der Anbieterbibliothek arbeiten. Für eine exklusive Markenstimme empfehlen wir einen Voice Clone.
Beim KI-Voiceover nutzen wir bestehende, lizenzierte KI-Stimmen für die Vertonung deines Projekts. Bei einer Custom Voice wird eine eigene KI-Stimme auf Basis einer realen menschlichen Stimme trainiert – die Stimme selbst ist dann das Produkt und gehört exklusiv zu deiner Marke.
Ja. Wenn dein Text bereits fertig und freigegeben ist, entfällt Modul 1 komplett und du buchst nur die Sprachgenerierung. Wir bereiten den Text lediglich für die Vertonung auf, falls Zahlen, Einheiten oder Abkürzungen ausgeschrieben werden müssen.
Ja, die Abwicklung läuft vollständig remote. Wir produzieren für Kunden in ganz Österreich, Deutschland und der Schweiz. Persönliche Termine sind in unserem Studio in 1070 Wien jederzeit möglich.