Start›KI-Technologien›SprachausgabeEnglish

Sprachausgabe: geschriebener Text wird vorgelesen

Neuronales Text-to-Speech macht aus Text natĂŒrlich klingendes Audio, in vielen Sprachen und Stimmen, und kann sagen, wann jedes Wort gesprochen wird.

Amazon PollyAzure AI SpeechText-to-SpeechP

Was ist Sprachausgabe?

Ein Sprachsynthese-Modell liest Text vor. Mit Auszeichnungen, meist SSML, steuern Sie Pausen, Betonung und Aussprache, und viele Services liefern die Zeitmarke jedes Wortes, damit Text beim Vorlesen hervorgehoben werden kann.

Eine eigene Stimme aus Ihren Aufnahmen ist auf den großen Plattformen möglich, und sie ist eine grĂ¶ĂŸere Verpflichtung, rechtlich wie technisch.

Rein gehtText, optional ausgezeichnet fĂŒr Pausen und Betonung
Raus kommtEine Audiodatei und auf Wunsch die Zeitmarke jedes Wortes
Typische EinsÀtzeSprachassistenten, Barrierefreiheit, E-Learning, Telefonsysteme

Vier Wege, sie zu betreiben

Jede der großen Clouds bietet sie als verwalteten Service an, und Sie können sie auch selbst betreiben. Dieselbe Aufgabe, eine andere Rechnung und eine andere Konsole.

Amazon Polly
Verwaltet auf AWS

Amazon Polly[1]

Der verwaltete Text-to-Speech-Service auf AWS, mit neuronalen Stimmen in vielen Sprachen und Speech Marks fĂŒr Wort-Zeitmarken.

Offizielle Dokumentation →
Azure AI Speech
Verwaltet auf Microsoft Azure

Azure AI Speech[2]

Der verwaltete Sprach-Service auf Microsoft Azure; Text to Speech ist eine seiner Funktionen, inklusive eigener Stimmen.

Offizielle Dokumentation →
Text-to-Speech
Verwaltet auf Google Cloud

Text-to-Speech[3]

Die verwaltete Sprachsynthese-API auf Google Cloud.

Offizielle Dokumentation →
P
Selbst betreiben

Piper[4]

Eine schnelle Open-Source-Sprachsynthese, die auf Ihrem eigenen Rechner lÀuft. Die Entwicklung ist vom archivierten Repository rhasspy/piper zu OHF-Voice/piper1-gpl umgezogen, das unter GPL-3.0 steht.

Projektseite →
Amazon Polly: Der verwaltete Service auf einer Seite, mit demselben Service auf den anderen Plattformen (Folie auf Englisch).
Der verwaltete Service auf einer Seite, mit demselben Service auf den anderen Plattformen (Folie auf Englisch).[5]

So sieht es in einer Architektur aus

Folien aus meiner Lehrveranstaltung zu KI-Architekturen an der FH Burgenland, aus echten Projekten (auf Englisch).

FĂŒnf fertige KI-Services, die Technologie darunter und wie sie anderswo heißt.
FĂŒnf fertige KI-Services, die Technologie darunter und wie sie anderswo heißt.[6]
Wann ein fertiger Service der richtige Start ist und wann Sie weiter unten schauen.
Wann ein fertiger Service der richtige Start ist und wann Sie weiter unten schauen.[6]

Wo ich es eingesetzt habe

Sprachausgabe ist nicht Teil meiner drei Referenzprojekte, und das ist Absicht: Die meisten internen Werkzeuge werden gelesen, nicht gehört. Dass es einen Service gibt, ist kein Grund, ihn zu nutzen.

Verwaltet und selbst betrieben zusammen: Hybrid

Bei einem fertigen Service verlÀsst der Aufruf Ihr Netzwerk. Die Hybrid-Entscheidung ist, was hinausgeht und in welchem Zustand: die ganze Datei, eine geschwÀrzte oder nur der Teil, der muss. Wo eine Datei gar nicht hinaus darf, lÀuft derselbe Schritt mit der Open-Source-Option in Ihrem GebÀude, und nur das Ergebnis, oder nichts, geht hinaus.[7]

Hybrid ist eine Entscheidung auf jeder Ebene. Bei Sprachausgabe ist die Frage, welcher Text zum Vorlesen hinaus darf.
Hybrid ist eine Entscheidung auf jeder Ebene. Bei Sprachausgabe ist die Frage, welcher Text zum Vorlesen hinaus darf.[8]

Was hilft Ihnen als NĂ€chstes?

Entscheiden lernen

Der Kurs „From Managed to Hybrid“ zeigt, wo KI laufen sollte: was jede Ebene kostet, was Sie betreiben und wo Ihre Daten bleiben mĂŒssen. Er ist in Vorbereitung, mit einer kostenlosen Live-Session zum Start.

Linda MohamedLinda Mohamed
KI- und Cloud-Beraterin, AWS Community Hero, Wien

Gemeinsam bauen

ErzĂ€hlen Sie mir, was Sie bauen wollen. In 30 Minuten prĂŒfen wir, welcher der vier Wege zu Ihren Daten, Ihren Regeln und Ihrem Budget passt und ob AWS-Förderung fĂŒr einen Proof of Concept einen Teil abdeckt. So funktioniert AWS-Förderung →

Sie wissen schon, was Sie brauchen

Buchen Sie direkt den Workshop:

ai-solutions.wiki

Mehr auf ai-solutions.wiki

Meine offene Wissensbasis, mit lÀngeren Vergleichen, Preisnotizen und Quellen (auf Englisch).

Quellen

  1. Amazon Polly Dokumentation. https://docs.aws.amazon.com/polly/latest/dg/what-is.html
  2. Azure AI Speech Dokumentation. https://learn.microsoft.com/en-us/azure/ai-services/speech-service/text-to-speech
  3. Text-to-Speech Dokumentation. https://cloud.google.com/text-to-speech/docs
  4. Piper. https://github.com/OHF-Voice/piper1-gpl
  5. Linda Mohamed, Kursfolien “The projects”, MASE-3, FH Burgenland, September 2026
  6. Linda Mohamed, Kursfolien “How to run AI, layer by layer”, MASE-3, FH Burgenland, September 2026
  7. NIST glossary: hybrid cloud. https://csrc.nist.gov/glossary/term/hybrid_cloud
  8. Linda Mohamed, Kursfolien “Start here”, MASE-3, FH Burgenland, September 2026
  9. Amazon Polly, ai-solutions.wiki. https://ai-solutions.wiki/tools/amazon-polly/
  10. Azure Speech Services, ai-solutions.wiki. https://ai-solutions.wiki/tools/azure-speech-services/
  11. Pre-built AI services vs foundation models, ai-solutions.wiki. https://ai-solutions.wiki/comparisons/prebuilt-ai-services-vs-foundation-models/
  12. rhasspy/piper, archived repository. https://github.com/rhasspy/piper

Links geprĂŒft im September 2026. Produktnamen und Funktionen Ă€ndern sich: PrĂŒfen Sie die verlinkten Seiten, bevor Sie entscheiden.