Bedrock, SageMaker AI oder OpenShift AI? Die Ebene folgt der Randbedingung.
Eine Karte mit sechs KI-Architektur-Ebenen, von fertigen Services bis zu eigenen GPUs, mit den Fragen, Diagrammen und Kostenzahlen aus meinen Kunden-Reviews und meiner Lehrveranstaltung an der Hochschule Burgenland.
- 6 Ebenen erklärt
- Entscheidungs-Tool
- Break-even-Zahlen
- Quellen verlinkt
Managed oder selbst betrieben ist die SaaS-, PaaS-, IaaS-Frage in neuem Gewand.
Jedes KI-System liegt auf einer Ebene. Je höher, desto mehr betreibt der Anbieter; je tiefer, desto mehr Kontrolle und desto mehr Betrieb für Ihr Team[2].
Wählen Sie die Ebene nach Randbedingungen, nicht nach Vorliebe: wohin die Daten dürfen, wie viel Anpassung nötig ist, wie gleichmäßig die Last ist, wie schnell die Antwort kommen muss und welche Skills Sie haben.
Hybrid ist keine Ebene. Hybrid entsteht, wenn eine Randbedingung, meist Datenresidenz, einen Teil des Systems auf eine tiefere Ebene zwingt. Zu Listenpreisen gewinnen verwaltete Services fast immer[3][4]; Residenz und Kontrolle, nicht der Preis, rechtfertigen den Eigenbetrieb.

Fünf Fragen, eine vorgeschlagene Ebene.
Läuft in Ihrem Browser, nichts wird gesendet. Der Vorschlag folgt derselben Logik wie der Start eines Architektur-Reviews.
Welche Ebene passt zu Ihrem Use Case?
Fünf Fragen. Der Vorschlag ist ein Startpunkt für das Review, kein Urteil.
1. Was soll die KI tun?
2. Wohin dürfen die Daten?
3. Wie viel Anpassung?
4. Wie gleichmäßig und groß ist die Last?
5. Wer würde es betreiben?
Sechs Ebenen, wer was betreibt.
Beispiele zuerst auf AWS, Entsprechungen anderer Clouds wo vorhanden. Service-Namen ändern sich, die Ebenen bleiben.
| Ebene | Name | Beispiele | Was Sie betreiben |
|---|---|---|---|
| L0 | Consumer-KI-Produkt | Claude, Microsoft 365 Copilot, Gemini in Workspace, Notion AI | Den Tenant: Anmeldung, Aufbewahrung, Konnektoren |
| L1 | Fertige Fähigkeit | Amazon Textract, Transcribe, Rekognition, Comprehend, Bedrock Data Automation | Ihr Prozess ruft eine API auf und bekommt strukturierte Daten |
| L2 | Verwaltetes Modell | Amazon Bedrock mit Knowledge Bases, Guardrails und AgentCore; Microsoft Foundry; Vertex AI | Modellwahl, Prompts, Retrieval, Guardrails, Evaluierung |
| L3 | Verwaltete Plattform | Amazon SageMaker AI; Azure Machine Learning; Vertex AI | Ihre Daten, Code, Trainingsjobs und Endpoints |
| L4 | Eigene Plattform | Red Hat OpenShift AI auf ROSA, ARO oder on-premises; Kubernetes mit vLLM und KServe | Laufzeit, Upgrades, Skalierung, Ausfälle |
| L5 | Infrastruktur | GPU-Instanzen wie EC2 G6e, AWS Outposts, eigene Racks; FSx for NetApp ONTAP als Speicherbrücke | Maschinen, Netzwerke und Speicher |
Plattform mieten oder Plattform halten.
SageMaker AI betreibt den ML-Lebenszyklus für Sie[7]. OpenShift AI bietet denselben Lebenszyklus auf einer Plattform, die Sie betreiben: auf ROSA, ARO oder on-premises[11][12].

Nach Datenklasse routen.
Amazon Bedrock läuft nicht auf AWS Outposts; lokale Daten erreichen Agenten und Tools[15][16]. Das praktische Muster ist Routing: ein verwaltetes Modell in einer EU-Region für Daten, die hinaus dürfen, ein selbst betriebenes Modell im Haus für Daten, die bleiben müssen.

Wann rechnet sich die eigene GPU?
Listenpreise us-east-1, geprüft im August 2026[3][4][5]. Der Break-even ist eine Auslastungsfrage, keine Fähigkeitsgrenze[6].
| Modell | Amazon Bedrock | Selbst betrieben auf EC2 | Break-even pro Monat |
|---|---|---|---|
| Llama 3.1 8B Instruct | 0,22 USD pro 1 Mio. Tokens | g6e.xlarge, 1,861 USD/h = 1.358,53 USD pro 730-h-Monat | 6,18 Mrd. Tokens (rund 2.350 Tokens/s rund um die Uhr) |
| Llama 3.3 70B Instruct | 0,72 USD pro 1 Mio. Tokens | g6e.12xlarge, 10,49 USD/h on demand | 10,6 Mrd. Tokens |
| Llama 3.3 70B Instruct | 0,72 USD pro 1 Mio. Tokens | g6e.12xlarge, 6,61 USD/h mit 1-Jahres-Reservierung | 6,7 Mrd. Tokens |
Aus den zitierten Listenpreisen abgeleitet. Ohne Speicher, Datenübertragung, Personal und Plattform; all das verschiebt den Break-even nach oben. Eigene Zahlen im Rechner (Englisch).
Die Ebenen-Entscheidung schriftlich.
Ein Workshop mit Ihren Architektinnen, Architekten und der Datenverantwortung. Ergebnisse nach Wahl, je 1.000 €. Standard: Ebenen-Entscheidung und Kosten- und Break-even-Blatt.
KI-Architektur-Review
Intake, ein Workshop von 3 bis 4 Stunden, schriftliche Ergebnisse innerhalb von 5 Werktagen.
je 2.000 €, 3 bis 4 Stunden, remote oder vor Ort
Lieferung innerhalb von 5 Werktagen nach der letzten Session.
Ebenen-Review
Review + Diagramm
Architektur-Begleitung
Die AWS-Services hinter dieser Arbeit.
Kurz erklärt: die Services, die ich für solche Projekte einsetze. Jeder Name verlinkt auf die offizielle AWS-Dokumentation.
Amazon Textract
Liest Text, Formulare und Tabellen aus gescannten Dokumenten und liefert sie als strukturierte Daten.
Amazon Bedrock
Verwalteter Zugriff auf Foundation Models mehrerer Anbieter über eine API. Sie wählen Modell und Prompt, AWS betreibt das Modell.
Amazon Bedrock AgentCore
Laufzeit, Speicher, Identität und Tool-Gateway für KI-Agenten aus beliebigen Frameworks wie Strands oder CrewAI.
Amazon SageMaker AI
Verwaltete Plattform für den gesamten ML-Lebenszyklus: Notebooks, Trainingsjobs, Model Registry und Endpoints.
Red Hat OpenShift Service on AWS (ROSA)
Verwaltete OpenShift-Cluster in Ihrem AWS-Account. Die Basis, um OpenShift AI neben anderen AWS-Services zu betreiben.
Amazon EC2 G6e instances
GPU-Instanzen mit NVIDIA-L40S-Karten für selbst betriebene Inferenz, zum Beispiel mit vLLM.
AWS Outposts
Von AWS verwaltete Racks im eigenen Rechenzentrum für Workloads, die vor Ort bleiben müssen.
Amazon FSx for NetApp ONTAP
Verwalteter NetApp-Dateispeicher auf AWS. Mit S3 Access Points verbindet er lokale Fileshares und Cloud-KI-Services.
Was vor der Buchung oft gefragt wird.
Was ist der Unterschied zwischen Amazon Bedrock und SageMaker AI?
Bedrock ist ein verwalteter Modell-Service: Sie rufen Foundation Models über eine API auf und konfigurieren Prompts, Retrieval, Guardrails und Agenten. SageMaker AI ist eine verwaltete ML-Plattform: Sie bringen Daten und Code, trainieren und hosten eigene Modelle.
Wann lohnt sich Red Hat OpenShift AI?
Wenn eine Randbedingung verlangt, dass Sie die Plattform halten: Daten, die das Haus nicht verlassen dürfen, dieselbe Plattform in Cloud und Rechenzentrum oder volle Kontrolle über die Modell-Laufzeit. Dafür braucht es ein Team für OpenShift und GPUs.
Ist ein selbst betriebenes Open-Weight-Modell günstiger als Bedrock?
Nur bei hoher, gleichmäßiger Auslastung. Für Llama 3.1 8B auf einer g6e.xlarge liegt der Break-even zu Listenpreisen bei rund 6,18 Milliarden Tokens pro Monat, ohne Personal- und Plattformkosten.
Läuft Bedrock on-premises?
Nein. Bedrock ist ein regionaler Service und lässt sich nicht auf AWS Outposts installieren. Für lokale Inferenz betreiben Sie ein Modell selbst, zum Beispiel mit vLLM auf OpenShift AI, und routen nach Datenklasse.
Was kostet das Architektur-Review?
2.000 € für den Workshop plus 1.000 € pro schriftlichem Ergebnis. Das Standard-Review mit Ebenen-Entscheidung und Break-even-Blatt kostet 4.000 € netto.

Linda Mohamed
Ich unterrichte diese Karte in der Lehrveranstaltung „Von Managed zu Hybrid: KI-Architekturen“ an der Hochschule Burgenland und nutze sie in Kunden-Reviews auf AWS- und Red-Hat-Plattformen. AWS Community Hero, Organisatorin der AWS User Group Vienna, Betreuerin von ai-solutions.wiki. Sitz in Wien, remote in ganz Europa, auf Deutsch oder Englisch.
Woher die Fakten stammen.
Preise, Service-Namen und Limits ändern sich. Maßgeblich sind die verlinkten offiziellen Seiten; die Zahlen auf dieser Seite wurden im September 2026 geprüft.
- AWS: AI services overview
- AWS shared responsibility model
- AWS: Amazon Bedrock pricing (Llama 3.1 8B and Llama 3.3 70B, us-east-1, checked August 2026)
- AWS: Amazon EC2 On-Demand pricing (g6e.xlarge, g6e.12xlarge)
- AWS: Amazon EC2 Reserved Instances pricing
- NVIDIA NIM for LLMs: benchmarking and performance
- AWS: Amazon SageMaker AI pricing
- AWS: SageMaker AI model deployment options and limits
- AWS: Amazon Textract document limits
- AWS: What is Amazon Bedrock AgentCore?
- Red Hat: OpenShift AI supported configurations 3.x
- Red Hat OpenShift AI Self-Managed 3.5 documentation
- Red Hat: ROSA architecture models
- AWS: FSx for NetApp ONTAP, S3 access points
- AWS Machine Learning Blog: RAG with data residency using AWS hybrid and edge services
- AWS Outposts rack
- vLLM documentation
- AWS: Amazon Bedrock cross-Region inference
- The C4 model for visualising software architecture
- ai-solutions.wiki: On-premise vs cloud AI
- ai-solutions.wiki: AI total cost of ownership
- ai-solutions.wiki: Capacity planning for AI
- AWS: Custom Model Import in Amazon Bedrock
Beginnen Sie mit einem Gespräch.
30 Minuten für Ihre Idee, Ihre Daten und den richtigen Einstieg. Oder 15 Minuten, wenn Sie nur eine Frage haben.
- Welche Ebene Ihr Use Case braucht
- Wohin Ihre Daten dürfen
- Ob Hybrid-Routing sich lohnt
- Was das Review abdeckt
Wien, Österreich · remote in ganz Europa · [email protected]