Seminar / Training
Multimodale Suche verbindet Text, Bilder und weitere Signale in einem gemeinsamen oder in mehreren spezialisierten Vektorräumen. Das Datenmodell muss die unterschiedlichen Repräsentationen erhalten, ohne Abfrage und Betrieb unnötig zu verkomplizieren.
Das Seminar entwickelt eine Anwendung, die Text-zu-Bild-, Bild-zu-Bild- und kombinierte Suchpfade unterstützt. Mehrere Repräsentationen werden gezielt gefiltert, fusioniert und anhand fachlicher Testfälle bewertet.
Inhaltsverzeichnis
- Zielsetzung
- Zielgruppe
- Voraussetzungen
- Seminarinhalte
- Praxisübungen
- Methodik
Zielsetzung
- Gemeinsame und getrennte multimodale Embedding-Räume unterscheiden
- Named Vectors und Payloads für mehrere Modalitäten modellieren
- Text-zu-Bild-, Bild-zu-Bild- und kombinierte Queries umsetzen
- Multi-Representation Retrieval und Fusion kontrolliert einsetzen
- Qualität, Speicherbedarf und Latenz multimodaler Systeme bewerten
Zielgruppe
Machine-Learning-Engineering, Computer Vision, Search Engineering, Backend-Entwicklung, RAG-Entwicklung und technische Architektur.
Voraussetzungen
Qdrant-Grundlagen, Python-Kenntnisse und Grundverständnis von Embeddings. Erfahrung mit Bild- oder Sprachmodellen ist hilfreich.
Seminarinhalte
Tag 1: Multimodales Datenmodell und Cross-Modal Search
- Schritt 1: Anwendungsfälle zerlegen
Modalitäten, Query-Arten, fachliche Filter, Ergebnisobjekte und Qualitätsanforderungen werden in eine Suchmatrix überführt.
- Schritt 2: Embedding-Räume auswählen
Gemeinsame Text-Bild-Modelle und modalitätsspezifische Modelle werden hinsichtlich Vergleichbarkeit, Dimension und Modellvertrag bewertet.
- Schritt 3: Collection modellieren
Named Vectors, Point-ID, Quellobjekt, Vorschaudaten, Rechte, Kategorien und technische Modellmetadaten werden strukturiert.
- Schritt 4: Daten ingestieren
Text- und Bildaufbereitung, Batch-Inferenz, Fehlerbehandlung, Mehrfachvektoren und Aktualisierung werden in eine reproduzierbare Pipeline integriert.
- Schritt 5: Cross-Modal Queries ausführen
Text-zu-Bild, Bild-zu-Bild und Suche über gespeicherte Referenzpunkte werden mit Payload-Filtern praktisch umgesetzt.
Tag 2: Mehrfachrepräsentation, Fusion und Qualität
- Schritt 6: Repräsentationen kombinieren
Semantischer Inhalt, Stil, Farbe, Kategorie oder andere spezialisierte Vektoren werden als getrennte Retrieval-Pfade modelliert.
- Schritt 7: Prefetch und Fusion einsetzen
Kandidaten aus mehreren Vektorfeldern werden mit getrennten Limits, Filtern und geeigneter Fusion zusammengeführt.
- Schritt 8: Fachliches Scoring ergänzen
Metadaten, Aktualität, Popularität und modalitätsspezifische Regeln werden ohne Verlust der Grundrelevanz in das Ranking eingebaut.
- Schritt 9: Ergebnisse darstellen
Vorschaudaten, Score-Erklärung, Gruppierung, Dublettenbehandlung und sichere Rückgabe sensibler Payload-Felder werden gestaltet.
- Schritt 10: Qualität und Kosten prüfen
Testsets, modalityspezifische Fehler, Recall, Latenz, Speicher pro Objekt und Inferenzkosten werden systematisch verglichen.
Praxisübungen
- Eine Collection mit Text- und Bildvektoren sowie fachlichen Payloads modellieren
- Text-zu-Bild- und Bild-zu-Bild-Suche mit identischem Datenbestand umsetzen
- Zwei spezialisierte Repräsentationen über Prefetch und Fusion kombinieren
- Ein multimodales Testset mit Qualitäts- und Latenzkennzahlen auswerten
Methodik
Kurze Fachimpulse werden unmittelbar mit Demonstrationen, angeleiteten Laboraufgaben, Mess- und Kontrollpunkten sowie dokumentierten Praxisübungen verbunden. Jeder Arbeitsschritt endet mit einer technischen Prüfung, einer Einordnung typischer Fehlerbilder und einem wiederverwendbaren Ergebnis für den eigenen Projekt- oder Betriebskontext.
Fachbereichsleitung, Trainerleitung und Ansprechpersonen
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de
Seminardetails
| Dauer: | 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.198 zzgl. MwSt. Inhaus: € 3.400 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Machine-Learning-Engineering, Computer Vision, Search Engineering, Backend-Entwicklung, RAG-Entwicklung und technische Architektur. |
| Voraussetzungen: | Qdrant-Grundlagen, Python-Kenntnisse und Grundverständnis von Embeddings. Erfahrung mit Bild- oder Sprachmodellen ist hilfreich. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, angeleitete Übungen und Praxisaufgaben am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
