Start›KI-Technologien›BilderkennungEnglish

Bild- und Objekterkennung: was auf einem Bild ist

Computer-Vision-Modelle sehen sich ein Bild oder ein Video-Frame an und liefern, was sie erkennen: Objekte, Szenen, Text oder Gesichter, jeweils mit einem Konfidenzwert.

Amazon RekognitionAzure AI VisionCloud Vision API and Video IntelligenceYOLO from Ultralytics

Was sind Bild- und Objekterkennung?

Bilderkennung beantwortet „Was ist auf diesem Bild?“ mit Labels. Objekterkennung geht einen Schritt weiter und liefert auch, wo jedes Objekt ist, als Rahmen darum. Beides funktioniert auf einzelnen Bildern und auf Frames aus einem Video.

Fertige Services kennen einen großen öffentlichen Satz an Labels. Wenn Ihre Objekte darin nicht vorkommen, trainieren Sie mit eigenen Beispielen, entweder im verwalteten Service oder mit einem offenen Modell auf Ihrer eigenen GPU.

Rein gehtEin Bild oder ein Frame aus einem Video
Raus kommtLabels mit Konfidenzwert und Rahmen fĂŒr erkannte Objekte
Typische EinsĂ€tzeMedien verschlagworten, QualitĂ€tsprĂŒfung, Sicherheitschecks, Moderation

Vier Wege, sie zu betreiben

Jede der großen Clouds bietet sie als verwalteten Service an, und Sie können sie auch selbst betreiben. Dieselbe Aufgabe, eine andere Rechnung und eine andere Konsole.

Amazon Rekognition
Verwaltet auf AWS

Amazon Rekognition[1]

Der verwaltete Bild- und Videoanalyse-Service auf AWS. Er liefert Labels, Text und Gesichter, und mit Custom Labels lernt er Objekte, die nur fĂŒr Ihr Unternehmen zĂ€hlen.

Offizielle Dokumentation →
Azure AI Vision
Verwaltet auf Microsoft Azure

Azure AI Vision[2]

Der verwaltete Computer-Vision-Service auf Microsoft Azure fĂŒr Bildanalyse und das Lesen von Text in Bildern.

Offizielle Dokumentation →
Cloud Vision API und Video Intelligence
Verwaltet auf Google Cloud

Cloud Vision API und Video Intelligence[3]

Die verwaltete Bildanalyse-API auf Google Cloud, mit einer eigenen Video Intelligence API fĂŒr Video.

Offizielle Dokumentation →
YOLO von Ultralytics
Selbst betreiben

YOLO von Ultralytics[4]

Eine Familie offener Objekterkennungsmodelle, die Sie auf Ihrer eigenen GPU betreiben. Ultralytics veröffentlicht sie unter AGPL-3.0, mit Enterprise-Lizenz fĂŒr geschlossene Produkte.

Projektseite →
Amazon Rekognition: Der verwaltete Service auf einer Seite, mit demselben Service auf den anderen Plattformen (Folie auf Englisch).
Der verwaltete Service auf einer Seite, mit demselben Service auf den anderen Plattformen (Folie auf Englisch).[5]

So sieht es in einer Architektur aus

Folien aus meiner Lehrveranstaltung zu KI-Architekturen an der FH Burgenland, aus echten Projekten (auf Englisch).

Die Video-Pipeline als Sequenz: Frames werden herausgeschnitten, Rekognition labelt sie, und die Agenten wÀhlen damit die Schnitte.
Die Video-Pipeline als Sequenz: Frames werden herausgeschnitten, Rekognition labelt sie, und die Agenten wÀhlen damit die Schnitte.[5]
FĂŒnf fertige KI-Services, die Technologie darunter und wie sie anderswo heißt.
FĂŒnf fertige KI-Services, die Technologie darunter und wie sie anderswo heißt.[6]

Wo ich es eingesetzt habe

Die Video-Pipeline

In meiner Video-Pipeline labelt Rekognition alle zwei Sekunden ein Frame, fĂŒr etwa 7 Cent pro Clip. Die Labels sind einer der Inputs, mit denen die Agenten entscheiden, welche Szenen in den Schnitt kommen.

Zum Bericht (Englisch) →

Verwaltet und selbst betrieben zusammen: Hybrid

Bei einem fertigen Service verlÀsst der Aufruf Ihr Netzwerk. Die Hybrid-Entscheidung ist, was hinausgeht und in welchem Zustand: die ganze Datei, eine geschwÀrzte oder nur der Teil, der muss. Wo eine Datei gar nicht hinaus darf, lÀuft derselbe Schritt mit der Open-Source-Option in Ihrem GebÀude, und nur das Ergebnis, oder nichts, geht hinaus.[7]

Die Enterprise-Version der Video-Pipeline: Die Dateien bleiben, wo sie sind, und die KI-Services lesen nur Frames.
Die Enterprise-Version der Video-Pipeline: Die Dateien bleiben, wo sie sind, und die KI-Services lesen nur Frames.[5]

Was hilft Ihnen als NĂ€chstes?

Entscheiden lernen

Der Kurs „From Managed to Hybrid“ zeigt, wo KI laufen sollte: was jede Ebene kostet, was Sie betreiben und wo Ihre Daten bleiben mĂŒssen. Er ist in Vorbereitung, mit einer kostenlosen Live-Session zum Start.

Linda MohamedLinda Mohamed
KI- und Cloud-Beraterin, AWS Community Hero, Wien

Gemeinsam bauen

ErzĂ€hlen Sie mir, was Sie bauen wollen. In 30 Minuten prĂŒfen wir, welcher der vier Wege zu Ihren Daten, Ihren Regeln und Ihrem Budget passt und ob AWS-Förderung fĂŒr einen Proof of Concept einen Teil abdeckt. So funktioniert AWS-Förderung →

Sie wissen schon, was Sie brauchen

Buchen Sie direkt den Workshop:

ai-solutions.wiki

Mehr auf ai-solutions.wiki

Meine offene Wissensbasis, mit lÀngeren Vergleichen, Preisnotizen und Quellen (auf Englisch).

Quellen

  1. Amazon Rekognition Dokumentation. https://docs.aws.amazon.com/rekognition/latest/dg/what-is.html
  2. Azure AI Vision Dokumentation. https://learn.microsoft.com/en-us/azure/ai-services/computer-vision/overview
  3. Cloud Vision API und Video Intelligence Dokumentation. https://cloud.google.com/vision/docs
  4. YOLO von Ultralytics. https://docs.ultralytics.com/
  5. Linda Mohamed, Kursfolien “The projects”, MASE-3, FH Burgenland, September 2026
  6. Linda Mohamed, Kursfolien “How to run AI, layer by layer”, MASE-3, FH Burgenland, September 2026
  7. S3 access points on FSx for NetApp ONTAP, AWS documentation. https://docs.aws.amazon.com/fsx/latest/ONTAPGuide/s3-access-points.html
  8. Amazon Rekognition, ai-solutions.wiki. https://ai-solutions.wiki/tools/amazon-rekognition/
  9. Azure Computer Vision, ai-solutions.wiki. https://ai-solutions.wiki/tools/azure-computer-vision/
  10. YOLO (Ultralytics), ai-solutions.wiki. https://ai-solutions.wiki/tools/yolo/
  11. Pre-built AI services vs foundation models, ai-solutions.wiki. https://ai-solutions.wiki/comparisons/prebuilt-ai-services-vs-foundation-models/

Links geprĂŒft im September 2026. Produktnamen und Funktionen Ă€ndern sich: PrĂŒfen Sie die verlinkten Seiten, bevor Sie entscheiden.