Vector Embeddings & Gelijkheidswiskunde Uitgelegd voor Beginners
Een toegankelijke gids over hoe AI betekenis representeert als ruimtelijke coördinaten, hoe cosinusgelijkheid werkt en de Normalize-then-Dot truc.

Traditionele zoekmachines vertrouwden volledig op het exact matchen van tekst. Als je zocht op "automobiel", slaat het systeem documenten over die alleen het woord "auto" bevatten.
Moderne kunstmatige intelligentie lost dit op door tekst om te zetten in vector embeddings. In plaats van letterlijke tekst te vergelijken, zetten embedding-modellen woorden, zinnen of documenten om in ruimtelijke coördinaten die de betekenis vastleggen.
In deze gids voor beginners leggen we uit hoe embeddings betekenis representeren in een geometrische ruimte, vergelijken we de wiskundige metrieken voor gelijkheid en bekijken we de prestatie-optimalisatie die vectordatabases gebruiken.
1. Wat is een Vector Embedding?
Een embedding-model is een neuraal netwerk dat werkt als een semantische vertaler. Het zet tekst om in een reeks getallen met een vaste lengte, een vector genoemd.
Input Text: "automobile" ---> Embedding Model ---> [0.024, -0.412, 0.891, ..., 0.105]
Input Text: "car" ---> Embedding Model ---> [0.021, -0.408, 0.887, ..., 0.112]Deze getallen zijn coördinaten op een hoogdimensionale kaart. Omdat "car" en "automobile" dezelfde betekenis hebben, plaatst het model hun coördinaten dicht bij elkaar.
2. De Geometrie van Taal: Dimensionaliteit Begrijpen
Het aantal getallen in een vector bepaalt de dimensionaliteit (bijv. 768 dimensies in standaardmodellen of 1536 in grotere modellen).
Hoewel mensen zich geen 768-dimensionale ruimte kunnen voorstellen, volgt de geometrie dezelfde regels als het tekenen van 2D-pijlen op papier:
- Elke vector begint bij de oorsprong
[0, 0, ... 0]. - De vectorwaarden geven aan hoe ver de pijl reikt langs elke as.
- De punt van de pijl komt uit op een uniek punt in de semantische ruimte.
2D Vector Space Visualization:
Y Axis (Concept: Technology)
^
| * "laptop" [2.1, 4.8]
| * "computer" [2.3, 4.5]
|
| * "banana" [4.9, 0.4]
+------------------------------------------------> X Axis (Concept: Food)Belangrijke regel: Probeer nooit één enkele coördinaat te isoleren. De betekenis is verdeeld over het gehele patroon van alle dimensies samen.
3. Wiskundige Metrieken: Afstand Meten
Om te bepalen of twee teksten dezelfde betekenis hebben, meten computers de afstand tussen hun vectorpijlen:
1. Vector Magnitude (L2-norm)
Meet de lengte van de pijl van de oorsprong tot de punt:
2. Inproduct (Dot Product)
Vermenigvuldigt overeenkomstige coördinaten van twee vectoren en telt deze op:
3. Euclidische Afstand (L2-afstand)
Meet de rechte afstand tussen de punten van twee vectorpijlen:
4. Cosinusgelijkheid (Cosine Similarity)
Meet de hoek tussen twee vectorpijlen, ongeacht hun lengte:
- De gouden standaard voor het zoeken van tekst: Als een korte zoekopdracht van 3 woorden en een artikel van 500 woorden over hetzelfde onderwerp gaan, wijzen hun pijlen in dezelfde richting ().
4. Productie-engineering: De "Normalize-Then-Dot" Truc
Het berekenen van cosinusgelijkheid vereist delingen die veel rekenkracht vragen bij miljoenen zoekopdrachten per seconde.
Vectordatabases (zoals Pinecone, Milvus, pgvector) gebruiken een slimme wiskundige truc:
Stap 1: Normaliseren bij opslag
Wanneer een vector wordt opgeslagen, normaliseert het systeem deze tot een lengte van precies ():
Stap 2: Vereenvoudigde zoekopdracht
Als beide vectoren een lengte van hebben ( en ), wordt de noemer in de formule gelijk aan :
Door vooraf te normaliseren verandert cosinusgelijkheid direct in een eenvoudig inproduct. De database vermijdt delingen tijdens het zoeken en levert maximale snelheid met exact dezelfde nauwkeurigheid.