Základným problémom multimodálnych systémov je heterogenita dát. Zatiaľ čo obrazové dáta sú reprezentované ako trojrozmerné matice intenzity pixelov, zvuk je časový rad frekvencií a text je sekvencia diskrétnych indexov v slovníku. Mechanizmus cross-modal alignment využíva kontrastné učenie (Contrastive Learning) na to, aby tieto odlišné štruktúry "pritiahol" k sebe v latentnom priestore.
⚠ Technické upozornenie
Nesprávne nastavenie hyperparametrov pri zarovnávaní vedie k tzv. "modelovému kolapsu", kedy systém prestáva rozlišovať medzi jemnými nuansami v obraze a priraďuje im identické textové popisy. Je nevyhnutné udržiavať teplotu softmax funkcie v rozmedzí 0.07 až 0.1.
V praxi to znamená, že pri trénovaní systému Handshakeco používame miliardy párov (obraz-text), kde model penalizujeme, ak sú vektory nesúvisiaceho textu a obrazu príliš blízko. Tento proces vyžaduje extrémny výpočtový výkon, ktorý zabezpečujú naše klastre popísané v sekcii AI Monitor. Výsledkom je systém, ktorý dokáže "vidieť" a "počuť" v rovnakom kontexte ako človek.
- Inicializácia enkodérov pre každú modalitu samostatne.
- Projekcia výstupov do spoločnej dimenzie (napr. 768-d vektor).
- Výpočet kosínusovej podobnosti medzi vektormi.
- Optimalizácia straty (Loss function) pomocou techniky InfoNCE.