임베딩(Embedding)이란?
사람이 쓰는 자연어를 기계가 이해할 수 있도록 벡터값으로 변환하는 과정 또는 그 결과를 의미한다.
이미지, 텍스트, 머싱 러닝에서는 벡터를 사용해 유사한 개체를 검색하는데, *벡터 데이터베이스에서 서로 가까운 두 개의 벡터를 찾기만 하면 되는 것이다.
예를 들어 해커톤에서 팀을 구성할 때, 하나의 이상적인 기준값을 놓고 학생이 그 기준값과 얼마나 가까운지를 비교해
팀을 구성할 때 어떠한 기준치를 놓고, 프로젝트 수준과 학년 등이 기준과 비슷한 사람들에게 팀장직을 맡긴다고 생각해보자. 정훈이와 경수가 있다고 가정하고 둘의 학년, 학점, 대회 참여 경험, 팀 프로젝트 숙련도를 살펴보면 다음과 같다.
| 이름 | 학년 | 학점 | 대회 참여 경험 | 팀 프로젝트 숙련도(~10) |
| 서정훈 | 3 | 4.5 | 6 | 9.5 |
| 도경수 | 2 | 3.8 | 2 | 7 |
기준치: {3, 4,5, 5, 10}
서정훈: {3, 4.5, 6, 9.5}
도경수: {2, 3.8, 2, 7}
머싱 러닝 모델은 정훈이가 팀장직에 더 어울린다고 식별할 수 있다. 정훈이의 벡터값이 기준치의 벡터값과 더 유사하기 때문이다.
기준치를 다시 보며 왜 그런지에 대해 찾아보자. 기준치는 3학년, 학점 4.5, 대회 참여는 약 5회, 숙련도는 10점이다. 그런데 경수가 2학년인 데에 비해 정훈이는 3학년이고 학점도 3.8인 경수에 비해 4.5로 기준에 더 가깝다. 또한 다른 데이터도 마찬가지로 기준치와 유사하다.
'기타' 카테고리의 다른 글
| [기타] VS Code 포맷팅 오류 기록 (0) | 2026.02.06 |
|---|
댓글