Mô hình & Suy luận
Một nhà cung cấp (provider) là ai chạy AI (OpenAI, Anthropic, máy tính của chính bạn, hoặc Rephlo). Một mô hình (model) là cỗ máy thực sự tạo ra văn bản. Một nhà cung cấp thường cung cấp nhiều mô hình, và bạn chọn mô hình nào sẽ chạy cho mỗi lệnh hoặc cuộc trò chuyện.
Nắm rõ sự khác biệt này chính là chìa khóa để kiểm soát tốc độ, chất lượng, quyền riêng tư và chi phí.
Ba cách Rephlo chạy AI
Rephlo có thể chạy một yêu cầu theo một trong ba cách khác nhau. Bạn chọn cách phù hợp với nhu cầu của mình.
| Cách chạy AI | Chạy ở đâu | Ai trả tiền | Gói yêu cầu | Phù hợp nhất cho |
|---|---|---|---|---|
| Cloud (khóa c ủa riêng bạn) | Máy chủ của nhà cung cấp (OpenAI, Anthropic, Google, v.v.) | Bạn — được nhà cung cấp tính phí trên khóa API của riêng bạn | Gói Pro hoặc giấy phép vĩnh viễn (perpetual license) | Mô hình hàng đầu, toàn quyền kiểm soát |
| On-device (trên thiết bị) | Máy tính của chính bạn, hoàn toàn ngoại tuyến | Không ai cả — không tốn credit, không có hóa đơn từ nhà cung cấp | Gói Pro hoặc giấy phép vĩnh viễn (perpetual license) | Riêng tư, không cần internet, không tốn chi phí sử dụng |
| Rephlo-hosted (do Rephlo lưu trữ) | Dịch vụ suy luận của Rephlo | credit Rephlo từ gói của bạn | Đã bao gồm trong các gói trả phí | Tiện lợi, không cần quản lý khóa |
Giới hạn theo gói (Plan gating): Các nhà cung cấp bring-your-own-key (cloud và Ollama) và các mô hình on-device đều là tính năng dành cho gói Pro — chúng yêu cầu một gói Pro đang hoạt động (hoặc cao hơn) hoặc một giấy phép vĩnh viễn để sử dụng. Với các mô hình on-device, giới hạn này áp dụng cho cả việc tải xuống lẫn chạy mô hình; một khi đã mở khóa, chúng chạy với không tốn chi phí sử dụng và hoàn toàn ngoại tuyến. Dedicated API do Rephlo lưu trữ được bao gồm trong các gói trả phí và tiêu tốn credit.
1. Nhà cung cấp Cloud (mang khóa của riêng bạn)
Bạn dán một khóa API từ nhà cung cấp mà bạn đã có tài khoản. Rephlo hỗ trợ tám loại nhà cung cấp BYOK — bảy nhà cung cấp cloud (OpenAI, Anthropic, Google, Groq, xAI (Grok), OpenRouter, và bất kỳ endpoint tương thích OpenAI nào — bao gồm cả Azure OpenAI) cộng với Ollama cục bộ, chạy trên máy của chính bạn tại localhost:11434. Mỗi nhà cung cấp hiển thị danh sách mô hình riêng — bạn chọn từ bất kỳ mô hình nào nhà cung cấp đó đang cung cấp hiện tại (các mô hình GPT, Claude, Gemini mới nhất, và các mô hình khác).
Mức sử dụng được nhà cung cấp tính phí, trên khóa của bạn — Rephlo không bao giờ tính credit cho các lệnh gọi này. Thiết lập chúng tại Nhà cung cấp (Providers).
2. Mô hình on-device (riêng tư, miễn phí, ngoại tuyến)
Rephlo có thể chạy các mô hình mở hoàn toàn trên máy tính của chính bạn bằng các tệp mô hình GGUF thông qua một công cụ tích hợp sẵn. Sau khi một mô hình được tải xuống:
- Nó chạy với không cần internet — không có gì được gửi tới bất kỳ máy chủ nào.
- Nó không tốn credit và hoàn toàn miễn phí khi chạy.
- Mọi thứ ở lại hoàn toàn riêng tư trên máy của bạn.
Việc dùng các mô hình on-device — cả tải xuống lẫn chạy — đòi hỏi một gói Pro đang hoạt động (hoặc cao hơn) hoặc một giấy phép vĩnh viễn, giống như với nhà cung cấp BYOK cloud và Ollama. Một khi đã mở khóa, chúng chạy miễn phí credit và hoàn toàn ngoại tuyến.
Mỗi mô hình on-device đi kèm siêu dữ liệu giúp bạn chọn đúng mô hình: dung lượng tải xuống, điểm tốc độ (speed rating) và điểm độ chính xác (accuracy rating) (1–10), cùng lượng RAM cần thiết (mức tối thiểu và mức khuyến nghị). Hãy chọn một mô hình nhỏ hơn, nhanh hơn nếu máy của bạn có bộ nhớ hạn chế, hoặc một mô hình lớn hơn, chính xác hơn nếu bạn có dư RAM.
Một số mô hình on-device hỗ trợ chế độ tư duy (thinking mode) (hiển thị quá trình suy luận trước khi đưa ra câu trả lời cuối cùng). Các mô hình có khả năng suy luận như Qwen và Gemma tạo ra các suy nghĩ của chúng trong các khối đặc biệt; Rephlo tự động phát hiện điều này để xử lý phần suy luận một cách chính xác.
Duyệt, tải xuống và quản lý các mô hình này tại Mô hình on-device (On-Device Models).