Die kleinste Datei ist nicht automatisch das wirtschaftlichste Modell. Eine aggressive Quantisierung kann Speicher sparen, aber Ausgabegenauigkeit, Tool Calling oder Fachterminologie verschlechtern. Pruning und Distillation erfordern mehr Vorbereitung, können jedoch Architektur und Verhalten gezielter an das Betriebsziel anpassen.
Das Seminar verknüpft jede Optimierung mit Kalibrierdaten, einer unveränderten Baseline und einem Hardwarebenchmark. Entscheidungen werden anhand von Qualität, Speicher, Startzeit, Latenz, Durchsatz und Portabilität getroffen.
Lernziele
Nach Abschluss des Seminars können die behandelten Verfahren fachlich eingeordnet, technisch angewendet und anhand nachvollziehbarer Kriterien bewertet werden.
- Speicher- und Rechenbedarf eines Modells für Gewichte, Aktivierungen und KV-Cache abschätzen
- Quantisierungsverfahren und Modellformate passend zu Engine und Hardware auswählen
- Kalibrierdaten domänengerecht zusammenstellen und Qualitätsverluste systematisch messen
- Pruning und Wissensdistillation als alternative oder ergänzende Verfahren einordnen
- Optimierte Artefakte reproduzierbar konvertieren, dokumentieren und freigeben
Seminarinhalte
Die Inhalte verbinden Grundlagen, Architekturentscheidungen und praktische Umsetzung in einer konsistenten Arbeitsumgebung.
Messgrundlage
- Parameter, Datentyp, Gewichtsspeicher, KV-Cache und Laufzeitreserven
- Qualitätsbaseline für Fachaufgabe, Format, Tool Calling und lange Kontexte
- Hardwareprofil, unterstützte Kernele, Speicherbandbreite und Zielengine
- Messgrößen für Startzeit, Latenz, Durchsatz, Energie und Speicherauslastung
Quantisierung
- Post-Training Quantization und quantisierungsbewusstes Training im Vergleich
- Gewichts- und Aktivierungsquantisierung, per-channel und per-token Skalierung
- INT8, INT4, FP8, 4-Bit-Gleitkomma sowie GPTQ-, AWQ-, bitsandbytes- und GGUF-orientierte Workflows
- Kalibrierdatensatz, Ausreißer, Gruppenbreite und empfindliche Modellteile
- Qualitätsprüfung nach Quantisierung und engine-spezifische Portabilität
Pruning und Distillation
- Strukturiertes und unstrukturiertes Pruning sowie Grenzen realer Beschleunigung
- Teacher-Student-Design, Logits, Sequenzen und domänenspezifische Trainingsdaten
- On-policy und off-policy Distillation sowie Umgang mit unterschiedlichen Tokenizern
- Kombination von Pruning, Distillation und anschließender Quantisierung
Artefakte und Freigabe
- Konvertierungspipeline, Prüfsummen, Metadaten und Versionsabhängigkeiten
- A/B-Vergleich auf Zielhardware und statistisch belastbare Testprofile
- Akzeptanzschwellen, bekannte Einschränkungen und Rückfallartefakt
- Lizenz- und Provenienzfragen bei Teacher-Modellen und synthetischen Daten
Praktische Übungen
Die Übungen werden an einem durchgängigen, produktneutralen Beispielszenario durchgeführt und mit prüfbaren Kriterien ausgewertet.
- Speicherbedarf und KV-Cache für mehrere Zielkonfigurationen berechnen
- Ein Modell in zwei Quantisierungsvarianten konvertieren
- Domänenspezifischen Kalibrier- und Testsatz anwenden
- Qualität, Latenz, Durchsatz und Speicher auf Zielhardware vergleichen
- Einen begrenzten Teacher-Student-Distillationslauf ausführen und gegen die Student-Baseline bewerten
Zielgruppe
Geeignet für Teams mit konkreten Hardware-, Kosten- oder Edge-Vorgaben. Drei Tage sind erforderlich, um Quantisierung praktisch zu vergleichen, Pruning fachgerecht einzuordnen und einen vollständigen begrenzten Distillationslauf einschließlich Evaluation durchzuführen.
Methodik
Fachliche Einordnung, Trainerdemonstrationen, geführte Laborabschnitte, eigenständige Übungen und gemeinsame Auswertung wechseln einander ab. Konfigurationen und Entscheidungen werden so dokumentiert, dass sie nach dem Seminar reproduzierbar bleiben.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage: 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.797 zzgl. MwSt. Inhaus: € 5.100 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | ML Engineers, MLOps Engineers, Data Scientists, Edge-AI-Entwickler und Plattformverantwortliche |
| Voraussetzungen: | Python- und Linux-Kenntnisse sowie Grundlagen zu Transformer-Modellen, Inferenz und Evaluation |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
