다음에만 적용됩니다: Foundry(클래식) 포털. 이 문서는 새 Foundry 포털에서 사용할 수 없습니다.
새 포털에 대해 자세히 알아봅니다.
참고
이 문서의 링크는 현재 보고 있는 Foundry(클래식) 설명서 대신 새 Microsoft Foundry 설명서의 콘텐츠를 열 수 있습니다.
포함은 기계 학습 모델 및 알고리즘에서 쉽게 사용할 수 있는 특수한 형식의 데이터 표현입니다. 임베딩은 텍스트의 의미론적 의미를 정보가 조밀한 표현으로 나타낸 것입니다. 각 포함은 부동 소수점 숫자의 벡터입니다. 따라서 벡터 공간의 두 포함 사이의 거리는 원래 형식의 두 입력 간의 의미 체계 유사성과 상관 관계가 있습니다. 예를 들어 두 텍스트가 비슷한 경우 해당 벡터 표현도 유사해야 합니다. 임베딩은 Azure AI 검색(권장)와 같은 검색 시스템과 Azure Cosmos DB for MongoDB vCore, Azure SQL Database, Azure Database for PostgreSQL - Flexible Server와 같은 Azure 데이터베이스에서 벡터 유사도 검색을 지원합니다.
임베딩 모델
포함을 사용하면 벡터 공간에서 의미 체계 유사성을 캡처하여 단어를 나타내는 큰 입력에서 기계 학습을 더 쉽게 수행할 수 있습니다. 따라서 포함을 사용하여 두 텍스트 청크가 의미 체계적으로 관련되어 있는지 또는 유사한지 확인하고 유사성을 평가하는 점수를 제공할 수 있습니다.
코사인 유사성
Azure OpenAI 임베딩은 문서와 쿼리 간의 유사성을 계산하기 위해 종종 코사인 유사성을 사용합니다.
수학 관점에서 코사인 유사성은 다차원 공간에 프로젝션된 두 벡터 사이의 각도 코사인을 측정합니다. 크기 때문에 두 문서가 유클리드 거리만큼 멀리 떨어져 있는 경우 두 문서 사이에 더 작은 각도를 가질 수 있으므로 코사인 유사성이 더 높을 수 있으므로 이 측정값이 유용합니다. 코사인 유사성 수식에 대한 자세한 내용은 Cosine 유사성을 참조하세요.
유사한 문서를 식별하는 다른 방법은 문서 간의 일반적인 단어 수를 계산하는 것입니다. 문서 크기가 확장되면 서로 다른 항목 중에서도 더 많은 수의 일반 단어가 검색될 수 있기 때문에 이 방법은 확장되지 않습니다. 이러한 이유로 코사인 유사성은 보다 효과적인 대안을 제공할 수 있습니다.
다음 단계
- Azure OpenAI와 임베딩을 사용하여 문서 검색을 수행하는 방법에 대해 임베딩 자습서에서 자세히 알아보세요.
- Azure Cosmos DB for MongoDB vCore, Azure Cosmos DB for NoSQL, Azure SQL Database 또는 Azure Database for PostgreSQL - Flexible Server를 사용하여 임베딩을 저장하고 벡터(유사성) 검색을 수행합니다.
- Microsoft Fabric Real-Time Intelligence에서 Eventhouse를 Vector 데이터베이스로 사용합니다.
- 유사성 검색에 series_cosine_similarity 함수를 사용합니다.