Start›KI-Technologien›SpracherkennungEnglish

Spracherkennung: aus gesprochener Sprache wird Text

Transkription, auch automatische Spracherkennung genannt, macht aus Audio geschriebenen Text und hÀlt fest, wann jedes Wort gesagt wurde.

Amazon TranscribeAzure AI SpeechSpeech-to-TextWhisper

Was ist Spracherkennung?

Ein Spracherkennungsmodell hört Audio und schreibt auf, was gesagt wurde. Gute Services liefern zu jedem Wort einen Zeitstempel, erkennen, wer spricht, und nehmen ein eigenes Vokabular an, damit Produktnamen und AbkĂŒrzungen richtig herauskommen.

Die Zeitmarken sind oft wichtiger als die Wörter. Mit ihnen schneiden Sie Video, schreiben Untertitel oder springen an eine Stelle in einer Aufnahme.

Rein gehtEine Audiodatei oder ein Live-Stream
Raus kommtEin Transkript mit Zeitmarken pro Wort und Sprecherkennung
Typische EinsÀtzeUntertitel, Besprechungsnotizen, Call-Analysen, durchsuchbare Medienarchive

Vier Wege, sie zu betreiben

Jede der großen Clouds bietet sie als verwalteten Service an, und Sie können sie auch selbst betreiben. Dieselbe Aufgabe, eine andere Rechnung und eine andere Konsole.

Amazon Transcribe
Verwaltet auf AWS

Amazon Transcribe[1]

Der verwaltete Spracherkennungs-Service auf AWS. Sie senden Audio und bekommen ein Transkript mit Zeitmarken. AWS betreibt das Modell, das eigene Vokabular gehört Ihnen.

Offizielle Dokumentation →
Azure AI Speech
Verwaltet auf Microsoft Azure

Azure AI Speech[2]

Der verwaltete Sprach-Service auf Microsoft Azure, mit Spracherkennung im Batch und in Echtzeit.

Offizielle Dokumentation →
Speech-to-Text
Verwaltet auf Google Cloud

Speech-to-Text[3]

Die verwaltete Spracherkennungs-API auf Google Cloud.

Offizielle Dokumentation →
Whisper
Selbst betreiben

Whisper[4]

Ein Spracherkennungsmodell von OpenAI mit offenen Gewichten, unter MIT-Lizenz. Es lÀuft auf Ihrem eigenen Rechner oder Ihrer GPU, das Audio muss also nie hinaus.

Projektseite →
Amazon Transcribe: Der verwaltete Service auf einer Seite, mit demselben Service auf den anderen Plattformen (Folie auf Englisch).
Der verwaltete Service auf einer Seite, mit demselben Service auf den anderen Plattformen (Folie auf Englisch).[5]

So sieht es in einer Architektur aus

Folien aus meiner Lehrveranstaltung zu KI-Architekturen an der FH Burgenland, aus echten Projekten (auf Englisch).

Ein Clip durch die Video-Pipeline verfolgt: Transcribe schreibt das Transkript, mit dem Untertitel und Agenten arbeiten.
Ein Clip durch die Video-Pipeline verfolgt: Transcribe schreibt das Transkript, mit dem Untertitel und Agenten arbeiten.[5]
FĂŒnf fertige KI-Services, die Technologie darunter und wie sie anderswo heißt.
FĂŒnf fertige KI-Services, die Technologie darunter und wie sie anderswo heißt.[6]

Wo ich es eingesetzt habe

Die Video-Pipeline

In meiner Video-Pipeline schreibt Transcribe das Transkript hinter den Untertiteln, fĂŒr etwa 11 Cent pro Clip. Das eigene Vokabular war die eine Einstellung, die zĂ€hlte: Ohne es kamen die Produktnamen falsch heraus, und jeder weitere Schritt erbte den Fehler.

Zum Bericht (Englisch) →

Verwaltet und selbst betrieben zusammen: Hybrid

Bei einem fertigen Service verlÀsst der Aufruf Ihr Netzwerk. Die Hybrid-Entscheidung ist, was hinausgeht und in welchem Zustand: die ganze Datei, eine geschwÀrzte oder nur der Teil, der muss. Wo eine Datei gar nicht hinaus darf, lÀuft derselbe Schritt mit der Open-Source-Option in Ihrem GebÀude, und nur das Ergebnis, oder nichts, geht hinaus.[7]

Die Enterprise-Version der Video-Pipeline: Das Archiv bleibt auf dem NetApp-ONTAP-Speicher des Kunden, die KI-Services lesen es ĂŒber S3 Access Points.
Die Enterprise-Version der Video-Pipeline: Das Archiv bleibt auf dem NetApp-ONTAP-Speicher des Kunden, die KI-Services lesen es ĂŒber S3 Access Points.[5]

Was hilft Ihnen als NĂ€chstes?

Entscheiden lernen

Der Kurs „From Managed to Hybrid“ zeigt, wo KI laufen sollte: was jede Ebene kostet, was Sie betreiben und wo Ihre Daten bleiben mĂŒssen. Er ist in Vorbereitung, mit einer kostenlosen Live-Session zum Start.

Linda MohamedLinda Mohamed
KI- und Cloud-Beraterin, AWS Community Hero, Wien

Gemeinsam bauen

ErzĂ€hlen Sie mir, was Sie bauen wollen. In 30 Minuten prĂŒfen wir, welcher der vier Wege zu Ihren Daten, Ihren Regeln und Ihrem Budget passt und ob AWS-Förderung fĂŒr einen Proof of Concept einen Teil abdeckt. So funktioniert AWS-Förderung →

Sie wissen schon, was Sie brauchen

Buchen Sie direkt den Workshop:

ai-solutions.wiki

Mehr auf ai-solutions.wiki

Meine offene Wissensbasis, mit lÀngeren Vergleichen, Preisnotizen und Quellen (auf Englisch).

Quellen

  1. Amazon Transcribe Dokumentation. https://docs.aws.amazon.com/transcribe/latest/dg/what-is.html
  2. Azure AI Speech Dokumentation. https://learn.microsoft.com/en-us/azure/ai-services/speech-service/overview
  3. Speech-to-Text Dokumentation. https://cloud.google.com/speech-to-text/docs
  4. Whisper. https://github.com/openai/whisper
  5. Linda Mohamed, Kursfolien “The projects”, MASE-3, FH Burgenland, September 2026
  6. Linda Mohamed, Kursfolien “How to run AI, layer by layer”, MASE-3, FH Burgenland, September 2026
  7. S3 access points on FSx for NetApp ONTAP, AWS documentation. https://docs.aws.amazon.com/fsx/latest/ONTAPGuide/s3-access-points.html
  8. Amazon Transcribe, ai-solutions.wiki. https://ai-solutions.wiki/tools/amazon-transcribe/
  9. Azure Speech Services, ai-solutions.wiki. https://ai-solutions.wiki/tools/azure-speech-services/
  10. OpenAI Whisper, ai-solutions.wiki. https://ai-solutions.wiki/tools/whisper/
  11. AWS AI services vs Azure AI, ai-solutions.wiki. https://ai-solutions.wiki/comparisons/aws-vs-azure-ai/

Links geprĂŒft im September 2026. Produktnamen und Funktionen Ă€ndern sich: PrĂŒfen Sie die verlinkten Seiten, bevor Sie entscheiden.