Daten für KI auffindbar, nutzbar und wirtschaftlich betreibbar machen.
KI-Projekte scheitern selten am Modell, sondern an Daten, die nicht auffindbar, nicht vertrauenswürdig oder zu teuer zu verarbeiten sind. In diesem Seminar bauen Sie ein solides Verständnis dafür auf, wie Datenmanagement in der Cloud für KI und Analytics funktioniert und welche Entscheidungen früh getroffen werden müssen. Sie klären, wann ein Data Lake, ein Data Warehouse oder ein Lakehouse die passende Grundlage ist und wie sich Batch- und Streaming-Ansätze auf Aktualität, Komplexität und Kosten auswirken.
Sie gehen den Weg der Daten von der Aufnahme bis zur Nutzung durch: Ingestion in eine Landing Zone, Strukturierung in Raw- und Curated-Bereiche, ELT- und ETL-Muster sowie inkrementelle Loads und CDC-Grundlagen. Anschließend modellieren Sie Daten so, dass sie sowohl für Reporting als auch für KI taugen, inklusive Zeitbezug, Slowly Changing Dimensions und dem Vermeiden von Data Leakage. Ein Schwerpunkt liegt auf Governance: Data Catalog, Lineage, Verantwortlichkeiten, Qualitätsprüfungen und Sicherheitsmechanismen wie Rollenmodelle sowie Row- und Column-Level Security.
Sie lernen außerdem, wie Dateiformate, Partitionierung, Clustering und ACID-Tabellen im Lake die Performance bestimmen. Am Ende können Sie reproduzierbare Trainingsdaten-Sets bereitstellen, die Grundlage für Feature Stores verstehen und Datenpfade für Training und Inferenz sauber trennen.
AngebotszielCloud-Datenmanagement für KI: Lakes & Warehouses
- Grundlagen von Cloud-Datenmanagement für KI und Analytics verstehen
- Data Lakes, Warehouses und Lakehouse-Konzepte einordnen
- Datenqualität, Governance und Metadaten für KI-Projekte berücksichtigen
- Kosten, Performance und Skalierbarkeit von Datenplattformen bewerten
- Datenpipelines und Zugriffsmodelle konzeptionell planen
- Entscheidungen für tragfähige KI-Datenarchitekturen ableiten
ZielgruppeCloud-Datenmanagement für KI: Lakes & Warehouses
Das Angebot richtet sich an IT-Verantwortliche, Data Engineers, Data Analysts, Architekt/innen, Projektleitungen und Fachverantwortliche, die Datenplattformen für KI und Analytics planen oder nutzen.
VoraussetzungenCloud-Datenmanagement für KI: Lakes & Warehouses
- Grundverständnis von Datenbanken und SQL ist hilfreich.
- Erste Berührungspunkte mit Cloud-Services oder Analytics-Projekten sind von Vorteil.
InhalteCloud-Datenmanagement für KI: Lakes & Warehouses
- KI braucht Daten: Architektur-Entscheidungen
- Data Lake, Data Warehouse, Lakehouse: Abgrenzung und Einsatz
- Batch vs. Streaming: wann welche Pipeline sinnvoll ist
- Compute- und Storage-Entkopplung in der Cloud
- Typische Anti-Patterns, die KI-Projekte ausbremsen
- Datenaufnahme und -integration
- Ingestion-Muster: Landing Zone, Raw, Curated
- ELT vs. ETL und Auswirkungen auf Qualität und Kosten
- CDC-Grundlagen und inkrementelle Loads
- Umgang mit semi-strukturierten Daten (JSON, Logs)
- Datenmodellierung für Analytics und KI
- Star Schema, Data Vault: wann es sich lohnt
- Feature-taugliche Daten: Aggregationen, Zeitbezug, Leakage
- Dimensionen, Slowly Changing Dimensions (SCD)
- Semantische Schicht und Self-Service-Analytics
- Datenqualität, Governance und Sicherheit
- Data Quality Checks: Vollständigkeit, Plausibilität, Drift
- Data Catalog, Lineage und Ownership
- IAM, Rollenmodelle, Row- und Column-Level Security
- DSGVO-Praxis: Pseudonymisierung, Aufbewahrung, Löschung
- Formate, Tabellen und Performance
- Parquet, ORC, JSON: Auswirkungen auf Kosten und Laufzeit
- Partitionierung, Clustering und Dateigrößen
- ACID-Tabellen im Lake (z. B. Delta/Apache Iceberg/Hudi)
- Abfrage-Optimierung und Kostenkontrolle
- Bereitstellung für KI-Workloads
- Trainingsdaten-Sets reproduzierbar bereitstellen
- Feature Store Grundlagen und wann er sinnvoll ist
- Offline/Online-Serving: Datenpfade für Inferenz
- Monitoring: Datendrift, Schema-Änderungen, SLAs
BildungspfadCloud-Datenmanagement für KI: Lakes & Warehouses
- NoSQL für KI: Datenmodelle, die skalieren
- Data-Centric AI: Ohne Data Contracts kein ML
- KI-gestützte Signalanalyse (ELINT/SIGINT): Grundkurs
- Qdrant-Schulung: RAG und Hybrid Search im Betrieb
- Cloud-Datenmanagement für KI: Lakes & Warehouses
- Data Engineering: KI-Pipelines im Einsatz
AusbildungsnachweisCloud-Datenmanagement für KI: Lakes & Warehouses
Zertifikat der IAD GmbH
Sie erhalten ein Teilnahmezertifikat der IAD GmbH. Damit können Sie Ihr erworbenes Wissen dokumentieren.
im Angebot

