Trích xuất Embeddings & Đo tương đồng Cosine

Chạy mô hình Transformer (all-MiniLM-L6-v2) 100% trên trình duyệt qua WebAssembly để trích xuất vector 384 chiều và tính toán độ tương đồng ngữ nghĩa.

Đầu vào văn bản
Văn bản A
93 ký tự
Văn bản B
86 ký tự
Kết quả Cosine Similarityall-MiniLM-L6-v2

Chưa có dữ liệu so sánh

Nhập hai đoạn văn bản A và B ở khung bên trái hoặc chọn một mẫu có sẵn, sau đó bấm 'Tạo Embeddings & So sánh'.

Nhóm Trí tuệ nhân tạo (AI)•Tài liệu kỹ thuật & Đặc tả RFC

Tài liệu & Hướng dẫn chuyên sâu: Trích xuất Text Embeddings & Đo tương đồng Cosine Similarity (Client-Side AI)

1. Tổng quan & Nguyên lý hoạt động

Trong kỷ nguyên của Trí tuệ nhân tạo và Mô hình ngôn ngữ lớn (LLM), Vector Embeddings là nền tảng cốt lõi cho mọi hệ thống Semantic Search (Tìm kiếm ngữ nghĩa), RAG (Retrieval-Augmented Generation) và phát hiện nội dung tương đồng. Thay vì so khớp chuỗi ký tự thô ráp (như thuật toán Levenshtein hay Regex), Embeddings ánh xạ câu văn thành một điểm tọa độ trong không gian vector đa chiều (384 chiều với mô hình all-MiniLM-L6-v2), nơi các khái niệm gần nghĩa sẽ nằm sát cạnh nhau. Tiện ích Local Text Embeddings của Verdbench sử dụng thư viện Transformers.js và ONNX Runtime Web để chạy mạng nơ-ron Transformer trực tiếp trong trình duyệt thông qua WebAssembly và Web Worker. Người dùng có thể đối sánh hai đoạn văn bản bất kỳ, tính toán góc Cosine Similarity chuẩn xác và xem mảng vector nhị phân mà không cần gọi API OpenAI, không tốn chi phí token và bảo mật dữ liệu riêng tư 100%.

2. Ưu thế kiến trúc & Tính năng nổi bật

Mô hình Transformer all-MiniLM-L6-v2 100% Client-Side

Chạy mô hình học sâu hàng đầu của Hugging Face/Sentence Transformers trực tiếp qua WebAssembly (ONNX Runtime Web), không gửi bất kỳ ký tự nào lên máy chủ bên ngoài.

Tách luồng Web Worker tối ưu hiệu năng

Quá trình tải trọng số mô hình (~22MB chỉ nạp một lần duy nhất vào bộ nhớ cache) và tính toán ma trận vector được thực thi ngầm trên Web Worker, giữ cho giao diện React luôn mượt mà 60 FPS.

Trực quan hóa Cosine Similarity & Vector Inspector

Hiển thị điểm số tương đồng trực quan với thước đo phần trăm, phân cấp độ tin cậy ngữ nghĩa, cho phép mở rộng xem chi tiết và sao chép toàn bộ mảng 384 số thực đã chuẩn hóa L2.

3. Bảng tra cứu thang điểm Cosine Similarity và ứng dụng thực tiễn

Ý nghĩa của điểm số tương đồng Cosine (cos θ) trong không gian vector embedding:

Thang điểm CosineĐộ tương đồngBản chất ngữ nghĩaỨng dụng trong AI / Search
0.80 – 1.00Rất cao (High)Cùng thể hiện một ý tưởng cốt lõi, chỉ khác biệt về từ vựng đồng nghĩa hoặc ngữ pháp.Deduplication (lọc trùng lặp bài viết), khớp câu hỏi thường gặp FAQ chính xác tuyệt đối.
0.60 – 0.79Khá cao (Moderate)Chung miền tri thức, chia sẻ nhiều khái niệm liên đới (ví dụ: câu hỏi và câu trả lời tương ứng).RAG Context Retrieval (trích xuất ngữ cảnh đưa vào Prompt LLM), tìm kiếm ngữ nghĩa.
0.35 – 0.59Thấp (Low)Thuộc hai chủ đề khác biệt nhưng có thể chia sẻ một số từ khóa phụ hoặc phạm trù rộng.Gợi ý nội dung đọc thêm liên quan xa, phân cụm văn bản cấp vĩ mô.
0.00 – 0.34Không liên quan (Unrelated)Hai văn bản thuộc hai ngữ cảnh hoàn toàn tách biệt, phương hướng vector gần như vuông góc.Loại bỏ triệt để khỏi kết quả tìm kiếm để tránh sinh ảo giác (hallucination).
< 0.00Ngược hướng (Negative)Vector trỏ về hai hướng đối nghịch nhau trong không gian đa chiều.Nhận diện đối lập ngữ nghĩa sâu sắc hoặc phân cực cảm xúc (contrastive learning).

4. Câu hỏi thường gặp (FAQ)

Giải đáp các thắc mắc phổ biến của lập trình viên khi sử dụng tiện ích Trích xuất Text Embeddings & Đo tương đồng Cosine Similarity (Client-Side AI).

Vector Embedding là biểu diễn toán học của văn bản dưới dạng một mảng các số thực (ví dụ: [-0.0421, 0.0812, ...]). Mô hình 'all-MiniLM-L6-v2' nén ngữ nghĩa của câu văn vào 384 chiều không gian (dimensions). Con số 384 là tỉ lệ vàng giữa độ chính xác nhận thức ngữ nghĩa và kích thước mô hình siêu nhẹ (~22MB), cho phép chạy cực nhanh trên mọi thiết bị cá nhân mà vẫn đạt điểm số benchmark tương đương các mô hình máy chủ cồng kềnh hàng gigabyte.