





Beim Klonen der Stimme wird ein Modell mit Aufnahmen Ihrer Stimme trainiert; danach liest es jeden geschriebenen Text mit Ihrer Klangfarbe vor. Wir nutzen dafür ElevenLabs und setzen den Stimmklon in Projekten mit KI-Avataren und KI-Videos ein. Er ist in jedem KI-Avatar-Paket enthalten, auch in START für 2.900 €. Werbevideos ohne Avatar vertonen wir mit einer Sprecherstimme. Klonen lässt sich Ihre eigene Stimme oder die Stimme einer Person, die schriftlich eingewilligt hat; Aufnahmen anderer Personen ohne Einwilligung nehmen wir nicht an. Im Folgenden: was Sie aufnehmen, wie lange Texte klingen und wo die Technik an Grenzen stößt.


















Sie senden uns eine Sprachaufnahme, wir erstellen daraus ein Stimmmodell und vertonen damit die Skripte. Am Ende steht entweder eine Tonspur oder ein fertiges Video mit KI-Avatar, dessen Lippen mit dieser Spur synchronisiert sind.
Zum Klang: Bei Sätzen und Absätzen bis zu einer halben Minute klingt das Modell nah an einer echten Aufnahme. Bei langen Monologen verrät es sich durch Gleichmäßigkeit: Es verspricht sich nicht, macht keine zufälligen Atemgeräusche und wird nicht schneller, wo ein Mensch vor Begeisterung schneller würde. Deshalb setzen wir Pausen und Betonungen von Hand und teilen lange Texte in Blöcke, die wir danach zusammenfügen.
Was das Modell gut kann: ruhige, sachliche Sprache, die Erklärung einer Leistung, die Antwort auf eine häufige Kundenfrage, einen Lernabschnitt. Was es schlecht kann: Schauspiel, Schreien, Flüstern, komödiantische Betonung. Dafür braucht es professionelle Sprecher; eine Synthese ist hier kein sinnvoller Ersatz.
Wir brauchen eine Sprachaufnahme nach unserer Anleitung. Den Text stellen wir. Jedes ordentliche Mikrofon reicht, auch ein Smartphone in einem ruhigen Raum. Ruhe ist wichtiger als Technik: Hall, Klimaanlage und Straßenlärm schaden dem Modell mehr als ein einfaches Mikrofon.
Sie nehmen nach unserer Anleitung einige Minuten Sprache auf; zusammen mit dem Video für den Avatar (2 bis 3 Minuten mit dem Smartphone) und Wiederholungen sind das insgesamt etwa 15 Minuten. Zuerst nehmen Sie eine kurze Probe auf, wir hören sie an und erstellen eine erste Version der Stimme. Erfasst das Modell die Klangfarbe sicher, müssen Sie nichts nachaufnehmen. Klingt die Stimme in der Aufnahme müde oder ist Rauschen auf der Spur, bitten wir Sie, bestimmte Passagen neu aufzunehmen, und sagen Ihnen, welche. So verbringen Sie keinen Abend mit einer Aufnahme, die am Ende nicht passt.
Zeitlich läuft die Stimme im Plan des Hauptprojekts mit: Ein KI-Avatar dauert 14 Tage ab Projektstart (EXPERT 21 Tage), Werbevideos und KI-Videos 10 bis 21 Tage. Das Stimmmodell entsteht in den ersten Tagen des Projekts, weil sich sonst die Lippensynchronisation nicht prüfen lässt.
Senden Sie eine kurze Sprachnachricht, und wir sagen Ihnen, ob sich die Stimme für ein Modell eignet
Ohne zusätzliche Aufnahme und ohne Anzahlung: Wir hören die Probe an und sagen Ihnen, welches Paket sinnvoll ist.
Wir arbeiten mit Ihrer eigenen Stimme oder der Stimme einer Person, die eine Einwilligung unterschrieben hat. Welche gesetzlichen Vorgaben in Ihrem Land gelten, klären Sie mit Ihrer Rechtsberatung; unsere Regeln unten gelten in jedem Fall.
Stimmaufnahmen sind personenbezogene Daten, deshalb holen wir die Einwilligung schriftlich ein, als separates Dokument neben den übrigen Vertragsunterlagen. Hat die Person den Text als professioneller Sprecher eingesprochen, können zusätzlich Rechte an dieser Darbietung bestehen.
Was das in der Praxis bedeutet. Die Einwilligung holen wir von der Person ein, deren Stimme wir klonen; die Unterschrift des beauftragenden Unternehmens allein reicht nicht. Ist es die Stimme eines Mitarbeiters, unterschreibt der Mitarbeiter. Bringen Sie die Aufnahme eines Sprechers, eines Schauspielers oder einer bekannten Person mit, nehmen wir den Auftrag nicht an.
Bei Igor Nikitin, dem Gründer von WMT, war die eigene Stimme Voraussetzung: Sein Publikum kennt sie, eine fremde Vertonung hätte den Wiedererkennungswert zerstört. Die Stimme haben wir mit ElevenLabs geklont und das Gesicht als Avatar erstellt; danach sind elf Folgen im Hochformat für Reels erschienen.
Das Wichtigste, was das Klonen gebracht hat: Tempo ab der zweiten Folge. Sobald Stimme und Avatar eingerichtet sind und das Skript freigegeben ist, entsteht eine Folge in unter einer Stunde: Der Text geht in die Vertonung, die Tonspur in die Lippensynchronisation, das Video wird exportiert. Igor Nikitins Beitrag in dieser Phase: nur die Freigabe des Textes, ohne Aufnahmen und ohne Gespräche.
Ein weiteres Beispiel: Standart Ecology (Entsorgung, Rückbau und Rekultivierung). Acht Avatar-Videos sind auf den Leistungsseiten der Website eingebunden; die Conversion-Rate (Website-Besuch zu Anfrage) stieg um 36 % (Ergebnis aus einem einzelnen Projekt, ohne A/B-Test). Der Avatar ist eine mit KI erstellte Figur, die für das Unternehmen spricht, und zeigt keinen echten Mitarbeiter.
Sie führt keine Gespräche. Sie vertont einen vorab geschriebenen Text: Der Avatar beantwortet keine Fragen am Telefon, moderiert keinen Livestream und reagiert nicht auf Kommentare des Publikums. Ein interaktiver Avatar, der in Echtzeit antwortet, ist nicht Teil der Pakete; wir setzen ihn als Projekt ab 15.000 € um.
Sie singt nicht, eignet sich nicht für die Synchronisation von Filmen und bleibt bei jedem emotionalen Höhepunkt hinter einem echten Sprecher zurück.
Das Stimmmodell liegt im Konto des Dienstes, mit dem es erstellt wurde. Wir löschen es auf Ihre schriftliche Anfrage und verwenden es nicht in anderen Projekten. Müssen Daten nach den Richtlinien Ihres Unternehmens an einem bestimmten Ort gespeichert werden, sagen Sie uns das vor dem Start: Solche Anforderungen klären wir im Erstgespräch, weil die Leistung dann womöglich nicht passt.
Wem sie nichts bringt: Brauchen Sie ein einzelnes Video und können es selbst aufnehmen, kostet die eigene Aufnahme weniger. Das Klonen rechnet sich bei vielen Videos, die regelmäßig erscheinen. Ein schwaches Angebot wird durch eine geklonte Stimme auch nicht überzeugender.
Das Klonen der Stimme ist in jedem KI-Avatar-Paket enthalten.
KI-Avatar: START umfasst Avatar, Stimmklon und 20 Videos für 2.900 €, PRO 30 Videos für 3.900 €, EXPERT 50 Videos für 5.500 €. Dauer 14 Tage, bei EXPERT 21 Tage. Werbevideos und KI-Videos ohne Avatar: 20, 30 oder 50 Videos für 2.900, 3.900 oder 5.500 €, Dauer 10 bis 21 Tage. Wenn Sie laufend Videos brauchen, gibt es das Content-Abo Creative Unlimited: 4.500 € pro Monat für bis zu 40 Videos in allen Formaten. Alle Preise sind Nettopreise für Geschäftskunden.
Zahl der Videos, Formate und Tiefe der Skriptarbeit. Die Qualität der Stimme hängt nicht vom Paket ab, das Modell ist dasselbe.
Senden Sie eine kurze Sprachnachricht per Telegram (@clyovo_ai oder +7 919 997 99 62) oder per E-Mail an german@clyovo.ru. Daran erkennen wir, ob sich Ihre Stimme ohne Nachaufnahme für ein Modell eignet und welches Paket sinnvoll ist.
Die Fragen, die Kunden vor einer Anfrage stellen, und unsere Antworten.
Technisch ja, solche Aufträge nehmen wir aber nicht an: Wir brauchen die schriftliche Einwilligung der Person, deren Stimme geklont wird, als separates Dokument. Aufnahmen aus dem Internet, alte Werbung, Podcasts oder Telefonate ohne Einwilligung reichen dafür nicht.
Einige Minuten Sprache nach unserer Anleitung; zusammen mit dem Video für den Avatar und Wiederholungen sind es etwa 15 Minuten. Zuerst nehmen Sie eine kurze Probe auf: Wir hören sie an, bevor Sie alles aufnehmen, und sagen Ihnen, ob das reicht oder welche Passagen Sie ergänzen sollten.
Bei kurzen Sätzen klingt das Modell nah an einer echten Aufnahme. Bei einem Monolog von mehreren Minuten bemerken aufmerksame Zuhörer die gleichmäßige Atmung und das gleichmäßige Tempo. Wir gleichen das mit von Hand gesetzten Pausen und der Aufteilung langer Texte in Blöcke aus, ganz beseitigen lässt es sich nicht.
Vollständig ausschließen kann niemand, dass ein externer Dienst kompromittiert wird, und wir versprechen das auch nicht. Was wir tun: Dritten geben wir keinen Zugang zum Modell, in anderen Projekten verwenden wir es nicht, auf schriftliche Anfrage löschen wir es, und Dauer und Gebiet der Nutzung legen wir im Vertrag fest. Haben Sie strengere Anforderungen an die Datenspeicherung, besprechen Sie sie vor dem Start mit uns.
Sie brauchen Nacharbeit von Hand: Abkürzungen, Markennamen, Fremdwörter und Zahlen schreiben wir im Text so, wie sie klingen sollen, und hören jede Ersetzung ab.
Die Stimme erstellen wir als Teil eines Projekts mit Avatar oder Videos. Brauchen Sie nur eine Tonspur, schreiben Sie uns: Wir sagen Ihnen direkt, ob wir den Auftrag übernehmen und zu welchen Bedingungen, ohne Ihnen ein komplettes Paket zu verkaufen.
Das Modell löschen wir auf schriftliche Anfrage. Bei bereits veröffentlichten Videos ist es aufwendiger: Sie müssen von den Plattformen entfernt werden, auf denen sie erschienen sind, und das liegt bei Ihnen. Deshalb sollten Dauer und Gebiet der Nutzung gleich im Vertrag festgelegt werden.