Das Seminar vermittelt die fachlichen und technischen Grundlagen von Embeddings, Vektorräumen und Ähnlichkeitssuche. Modellwahl, Vorverarbeitung, Dimension, Normalisierung, Metriken, Qualitätsmessung und Versionswechsel werden so verbunden, dass Vektordaten für Milvus nachvollziehbar erzeugt und bewertet werden können.
Inhaltsverzeichnis
- Zielsetzung
- Grundprinzip von Embeddings
- Modellwahl und Domänenpassung
- Vorverarbeitung und Chunking
- Dimension, Normalisierung und Similarity Metrics
- Qualitätsmessung und Versionsmanagement
- Praxisprojekt
- Zielgruppe und Voraussetzungen
- Arbeitsweise
Zielsetzung
- Embeddings, Vektorräume und semantische Nähe verständlich erklären
- Geeignete Modelle und Vorverarbeitungen für Text, Bild oder andere Daten auswählen
- Dimension, Normalisierung und Similarity Metric korrekt aufeinander abstimmen
- Qualität mit geeigneten Testmengen und Retrieval-Metriken beurteilen
- Embedding-Versionen, Re-Embedding und Mischbestände kontrolliert verwalten
Grundprinzip von Embeddings
Embeddings bilden Inhalte als numerische Repräsentationen ab. Entscheidend ist nicht die einzelne Koordinate, sondern die relationale Struktur des Vektorraums.
- Schritt 1: Repräsentation verstehen: Token, Satz, Dokument, Bild oder Audioausschnitt werden als Eingabeobjekte und Vektoren als lernbasierte Merkmale eingeordnet.
- Schritt 2: Nähe interpretieren: Semantische Ähnlichkeit, Cluster, Ausreißer und Grenzen der Bedeutung werden an Beispielen untersucht.
- Schritt 3: Suchprozess verbinden: Query-Embedding, Kandidatensuche, Distanzberechnung und Ergebnisrangfolge werden als Pipeline dargestellt.
Praxisübung: Exploration eines kleinen Vektorraums mit ähnlichen, mehrdeutigen und fachfremden Beispielen.
Modellwahl und Domänenpassung
Ein populäres Modell ist nicht automatisch für jede Sprache, Domäne und Aufgabe geeignet. Auswahlkriterien werden messbar gemacht.
- Schritt 1: Anforderungen formulieren: Sprache, Eingabelänge, Modalität, Domänenvokabular, Lizenz, Laufzeit und Datenschutz werden erfasst.
- Schritt 2: Kandidaten vergleichen: Dimension, Modellgröße, Inferenzkosten, Mehrsprachigkeit und publizierte beziehungsweise eigene Benchmarks werden bewertet.
- Schritt 3: Pilot testen: Eine repräsentative Query-Dokument-Menge wird verwendet, um qualitative und quantitative Unterschiede sichtbar zu machen.
Praxisübung: Entwicklung einer Modellbewertungsmatrix für einen konkreten Suchfall.
Vorverarbeitung und Chunking
Die Qualität des Embeddings hängt stark davon ab, welche Inhalte gemeinsam eingebettet werden. Chunking und Metadaten müssen zur späteren Nutzung passen.
- Schritt 1: Inhalte bereinigen: Markup, Boilerplate, Duplikate, Zeichensätze und irrelevante Abschnitte werden kontrolliert behandelt.
- Schritt 2: Chunks bilden: Tokenlimit, semantische Grenzen, Überlappung, Tabellen und Überschriften werden auf Kontext und Treffergranularität abgestimmt.
- Schritt 3: Kontext erhalten: Dokument-ID, Abschnitt, Sprache, Version, Quelle und Parent-Bezug werden als Metadaten mitgeführt.
Praxisübung: Vergleich dreier Chunking-Strategien anhand derselben Dokumente und Suchfragen.
Dimension, Normalisierung und Similarity Metrics
Vektoren und Metriken müssen zueinander passen. Falsche Normalisierung oder uneinheitliche Modellverwendung führt zu schwer erkennbaren Qualitätsverlusten.
- Schritt 1: Metriken unterscheiden: Kosinusbezug, inneres Produkt und euklidische Distanz werden geometrisch und praktisch eingeordnet.
- Schritt 2: Normalisierung prüfen: Einheitslänge, Modellkonventionen und Auswirkung auf Rangfolgen werden experimentell untersucht.
- Schritt 3: Schema ableiten: Dimension, Datentyp, Metrik und Indexparameter werden konsistent im Milvus-Schema festgelegt.
Praxisübung: Messung derselben Query mit verschiedenen Metriken und normalisierten beziehungsweise nicht normalisierten Vektoren.
Qualitätsmessung und Versionsmanagement
Retrieval-Qualität wird mit einer gepflegten Testmenge statt nur durch Einzelbeispiele bewertet. Modellwechsel erhalten einen kontrollierten Lebenszyklus.
- Schritt 1: Ground Truth aufbauen: Reale Suchfragen, relevante Dokumente, Schwierigkeitsklassen und Negativbeispiele werden kuratiert.
- Schritt 2: Metriken berechnen: Recall@K, Precision@K, MRR, nDCG und qualitative Fehlerklassen werden passend zur Aufgabe ausgewählt.
- Schritt 3: Versionen migrieren: Modellkennung, Parallelindex, Re-Embedding, A/B-Test, Umschaltung und Rückfall werden geplant.
Praxisübung: Erstellung eines Evaluationssets und eines Freigabeplans für eine neue Embedding-Version.
Praxisprojekt
Alle Übungen werden in einer zusammenhängenden Laborumgebung durchgeführt. Ausgangsdaten, Konfiguration, Messwerte und Änderungen werden versioniert dokumentiert. Die technische Abnahme umfasst Funktionsfälle, definierte Fehlerfälle, Qualitätskontrollen und einen reproduzierbaren Wiederanlauf.
Zielgruppe und Voraussetzungen
Zielgruppe: Data Science, Machine Learning Engineering, Data Engineering, Softwareentwicklung, Solution Architecture, Produktmanagement und fachliche Suchverantwortung.
Voraussetzungen: Grundlegende Kenntnisse in Datenanalyse oder Softwareentwicklung; mathematische Spezialkenntnisse sind nicht erforderlich.
Arbeitsweise
Fachliche Einordnung, technische Demonstrationen und schrittweise Übungen wechseln sich ab. Jede Konfiguration wird begründet, praktisch geprüft und anhand klarer Erfolgskriterien dokumentiert. Dadurch entsteht eine direkt übertragbare Arbeitsgrundlage für Entwicklung, Architektur oder Betrieb.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de
Seminardetails
| Dauer: | 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.198 zzgl. MwSt. Inhaus: € 3.400 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Data Science, Machine Learning Engineering, Data Engineering, Softwareentwicklung, Solution Architecture, Produktmanagement und fachliche Suchverantwortung. |
| Voraussetzungen: | Grundlegende Kenntnisse in Datenanalyse oder Softwareentwicklung; mathematische Spezialkenntnisse sind nicht erforderlich. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
