• Informationsverarbeitung und angewandte Datentechnik GmbH
    Seit 43 Jahren Ihr Bildungspartner
  • 0 64 21 96 58-0

Informationsverarbeitung und angewandte Datentechnik GmbH

KKC_0167 | Cloud-Datenmanagement für KI: Lakes & Warehouses

Baue eine belastbare Datenbasis für KI: vom Rohdaten-Import bis zu kuratierten, sicheren Trainingsdaten in der Cloud.

Zusammenfassung
Infos zum Download

Daten für KI auffindbar, nutzbar und wirtschaftlich betreibbar machen.

KI-Projekte scheitern selten am Modell, sondern an Daten, die nicht auffindbar, nicht vertrauenswürdig oder zu teuer zu verarbeiten sind. In diesem Seminar bauen Sie ein solides Verständnis dafür auf, wie Datenmanagement in der Cloud für KI und Analytics funktioniert und welche Entscheidungen früh getroffen werden müssen. Sie klären, wann ein Data Lake, ein Data Warehouse oder ein Lakehouse die passende Grundlage ist und wie sich Batch- und Streaming-Ansätze auf Aktualität, Komplexität und Kosten auswirken.

Sie gehen den Weg der Daten von der Aufnahme bis zur Nutzung durch: Ingestion in eine Landing Zone, Strukturierung in Raw- und Curated-Bereiche, ELT- und ETL-Muster sowie inkrementelle Loads und CDC-Grundlagen. Anschließend modellieren Sie Daten so, dass sie sowohl für Reporting als auch für KI taugen, inklusive Zeitbezug, Slowly Changing Dimensions und dem Vermeiden von Data Leakage. Ein Schwerpunkt liegt auf Governance: Data Catalog, Lineage, Verantwortlichkeiten, Qualitätsprüfungen und Sicherheitsmechanismen wie Rollenmodelle sowie Row- und Column-Level Security.

Sie lernen außerdem, wie Dateiformate, Partitionierung, Clustering und ACID-Tabellen im Lake die Performance bestimmen. Am Ende können Sie reproduzierbare Trainingsdaten-Sets bereitstellen, die Grundlage für Feature Stores verstehen und Datenpfade für Training und Inferenz sauber trennen.

Angebotsziel
Cloud-Datenmanagement für KI: Lakes & Warehouses

  • Grundlagen von Cloud-Datenmanagement für KI und Analytics verstehen
  • Data Lakes, Warehouses und Lakehouse-Konzepte einordnen
  • Datenqualität, Governance und Metadaten für KI-Projekte berücksichtigen
  • Kosten, Performance und Skalierbarkeit von Datenplattformen bewerten
  • Datenpipelines und Zugriffsmodelle konzeptionell planen
  • Entscheidungen für tragfähige KI-Datenarchitekturen ableiten

Zielgruppe
Cloud-Datenmanagement für KI: Lakes & Warehouses

Das Angebot richtet sich an IT-Verantwortliche, Data Engineers, Data Analysts, Architekt/innen, Projektleitungen und Fachverantwortliche, die Datenplattformen für KI und Analytics planen oder nutzen.

Voraussetzungen
Cloud-Datenmanagement für KI: Lakes & Warehouses

  • Grundverständnis von Datenbanken und SQL ist hilfreich.
  • Erste Berührungspunkte mit Cloud-Services oder Analytics-Projekten sind von Vorteil.

Inhalte
Cloud-Datenmanagement für KI: Lakes & Warehouses

  • KI braucht Daten: Architektur-Entscheidungen
    • Data Lake, Data Warehouse, Lakehouse: Abgrenzung und Einsatz
    • Batch vs. Streaming: wann welche Pipeline sinnvoll ist
    • Compute- und Storage-Entkopplung in der Cloud
    • Typische Anti-Patterns, die KI-Projekte ausbremsen
  • Datenaufnahme und -integration
    • Ingestion-Muster: Landing Zone, Raw, Curated
    • ELT vs. ETL und Auswirkungen auf Qualität und Kosten
    • CDC-Grundlagen und inkrementelle Loads
    • Umgang mit semi-strukturierten Daten (JSON, Logs)
  • Datenmodellierung für Analytics und KI
    • Star Schema, Data Vault: wann es sich lohnt
    • Feature-taugliche Daten: Aggregationen, Zeitbezug, Leakage
    • Dimensionen, Slowly Changing Dimensions (SCD)
    • Semantische Schicht und Self-Service-Analytics
  • Datenqualität, Governance und Sicherheit
    • Data Quality Checks: Vollständigkeit, Plausibilität, Drift
    • Data Catalog, Lineage und Ownership
    • IAM, Rollenmodelle, Row- und Column-Level Security
    • DSGVO-Praxis: Pseudonymisierung, Aufbewahrung, Löschung
  • Formate, Tabellen und Performance
    • Parquet, ORC, JSON: Auswirkungen auf Kosten und Laufzeit
    • Partitionierung, Clustering und Dateigrößen
    • ACID-Tabellen im Lake (z. B. Delta/Apache Iceberg/Hudi)
    • Abfrage-Optimierung und Kostenkontrolle
  • Bereitstellung für KI-Workloads
    • Trainingsdaten-Sets reproduzierbar bereitstellen
    • Feature Store Grundlagen und wann er sinnvoll ist
    • Offline/Online-Serving: Datenpfade für Inferenz
    • Monitoring: Datendrift, Schema-Änderungen, SLAs

Bildungspfad
Cloud-Datenmanagement für KI: Lakes & Warehouses

Lernstufe 1
  • NoSQL für KI: Datenmodelle, die skalieren
  • Data-Centric AI: Ohne Data Contracts kein ML
Lernstufe 2
  • KI-gestützte Signalanalyse (ELINT/SIGINT): Grundkurs
  • Qdrant-Schulung: RAG und Hybrid Search im Betrieb
Lernstufe 3
  • Cloud-Datenmanagement für KI: Lakes & Warehouses
  • Data Engineering: KI-Pipelines im Einsatz

Ausbildungsnachweis
Cloud-Datenmanagement für KI: Lakes & Warehouses

Zertifikat der IAD GmbH

Sie erhalten ein Teilnahmezertifikat der IAD GmbH. Damit können Sie Ihr erworbenes Wissen dokumentieren.

NEU
im Angebot

KKC_0167 | Cloud-Datenmanagement für KI: Lakes & Warehouses
1.450,00 €(1.725,50 € inkl. 19% Mwst)