Tài liệu & Hướng dẫn chuyên sâu: Trích xuất Text Embeddings & Đo tương đồng Cosine Similarity (Client-Side AI)
1. Tổng quan & Nguyên lý hoạt động
Trong kỷ nguyên của Trí tuệ nhân tạo và Mô hình ngôn ngữ lớn (LLM), Vector Embeddings là nền tảng cốt lõi cho mọi hệ thống Semantic Search (Tìm kiếm ngữ nghĩa), RAG (Retrieval-Augmented Generation) và phát hiện nội dung tương đồng. Thay vì so khớp chuỗi ký tự thô ráp (như thuật toán Levenshtein hay Regex), Embeddings ánh xạ câu văn thành một điểm tọa độ trong không gian vector đa chiều (384 chiều với mô hình all-MiniLM-L6-v2), nơi các khái niệm gần nghĩa sẽ nằm sát cạnh nhau. Tiện ích Local Text Embeddings của Verdbench sử dụng thư viện Transformers.js và ONNX Runtime Web để chạy mạng nơ-ron Transformer trực tiếp trong trình duyệt thông qua WebAssembly và Web Worker. Người dùng có thể đối sánh hai đoạn văn bản bất kỳ, tính toán góc Cosine Similarity chuẩn xác và xem mảng vector nhị phân mà không cần gọi API OpenAI, không tốn chi phí token và bảo mật dữ liệu riêng tư 100%.
2. Ưu thế kiến trúc & Tính năng nổi bật
Chạy mô hình học sâu hàng đầu của Hugging Face/Sentence Transformers trực tiếp qua WebAssembly (ONNX Runtime Web), không gửi bất kỳ ký tự nào lên máy chủ bên ngoài.
Quá trình tải trọng số mô hình (~22MB chỉ nạp một lần duy nhất vào bộ nhớ cache) và tính toán ma trận vector được thực thi ngầm trên Web Worker, giữ cho giao diện React luôn mượt mà 60 FPS.
Hiển thị điểm số tương đồng trực quan với thước đo phần trăm, phân cấp độ tin cậy ngữ nghĩa, cho phép mở rộng xem chi tiết và sao chép toàn bộ mảng 384 số thực đã chuẩn hóa L2.
3. Bảng tra cứu thang điểm Cosine Similarity và ứng dụng thực tiễn
Ý nghĩa của điểm số tương đồng Cosine (cos θ) trong không gian vector embedding:
| Thang điểm Cosine | Độ tương đồng | Bản chất ngữ nghĩa | Ứng dụng trong AI / Search |
|---|---|---|---|
| 0.80 – 1.00 | Rất cao (High) | Cùng thể hiện một ý tưởng cốt lõi, chỉ khác biệt về từ vựng đồng nghĩa hoặc ngữ pháp. | Deduplication (lọc trùng lặp bài viết), khớp câu hỏi thường gặp FAQ chính xác tuyệt đối. |
| 0.60 – 0.79 | Khá cao (Moderate) | Chung miền tri thức, chia sẻ nhiều khái niệm liên đới (ví dụ: câu hỏi và câu trả lời tương ứng). | RAG Context Retrieval (trích xuất ngữ cảnh đưa vào Prompt LLM), tìm kiếm ngữ nghĩa. |
| 0.35 – 0.59 | Thấp (Low) | Thuộc hai chủ đề khác biệt nhưng có thể chia sẻ một số từ khóa phụ hoặc phạm trù rộng. | Gợi ý nội dung đọc thêm liên quan xa, phân cụm văn bản cấp vĩ mô. |
| 0.00 – 0.34 | Không liên quan (Unrelated) | Hai văn bản thuộc hai ngữ cảnh hoàn toàn tách biệt, phương hướng vector gần như vuông góc. | Loại bỏ triệt để khỏi kết quả tìm kiếm để tránh sinh ảo giác (hallucination). |
| < 0.00 | Ngược hướng (Negative) | Vector trỏ về hai hướng đối nghịch nhau trong không gian đa chiều. | Nhận diện đối lập ngữ nghĩa sâu sắc hoặc phân cực cảm xúc (contrastive learning). |
4. Câu hỏi thường gặp (FAQ)
Giải đáp các thắc mắc phổ biến của lập trình viên khi sử dụng tiện ích Trích xuất Text Embeddings & Đo tương đồng Cosine Similarity (Client-Side AI).
5. Công cụ liên quan
- Đếm Token AI & Tính chi phí APIĐếm token thời gian thực (o200k_base, cl100k_base), trực quan hóa tách từ và tính toán chi phí API cho GPT-4o, Claude 3.5 và Gemini 1.5.
- Trích xuất chữ từ ảnh (OCR)Nhận dạng chữ viết từ hình ảnh, ảnh chụp màn hình và tài liệu 100% trên trình duyệt qua WebAssembly Tesseract.js, bảo mật tuyệt đối.
- So sánh văn bảnSo sánh hai đoạn văn bản và làm nổi bật phần thêm, xóa và thay đổi.