Cấu hình
Chuyển văn bản và chi phí
Chọn whisper chạy trên máy (miễn phí), OpenAI key của riêng bạn, hoặc bất kỳ endpoint tương thích OpenAI nào, chẳng hạn máy GPU của riêng bạn. Âm thanh đi thẳng từ máy của bạn đến dịch vụ bạn chọn.
#Ai trả tiền, và dữ liệu đi đâu
Mô hình chi phí và mạng
- Nhà phát triển (Japan Marketing LLC) không trả tiền, không làm proxy và không tính phí cho bất kỳ việc chuyển văn bản hay sử dụng AI nào.
- Request đi thẳng từ máy tính của bạn đến OpenAI hoặc endpoint của bạn, không bao giờ qua server của nhà phát triển.
- Chi phí OpenAI được tính vào tài khoản OpenAI của chính bạn.
- Sắp xếp dùng Claude Code / Codex CLI mà bạn đã đăng nhập, trừ khi bạn chủ động chọn một API runner (
organizer.runner: "api:<provider>", xem Cấu hình bằng settings.json). Nó không bao giờ tự chuyển sang dùng API key.
#Các phương thức
Chọn trong Cài đặt → Chuyển văn bản → Engine. Popover Microphone & chuyển văn bản ở footer hiển thị lựa chọn hiện tại.
| Engine | Âm thanh được gửi đến | Chi phí |
|---|---|---|
| Trên máy (miễn phí) (mặc định) | Không đi đâu cả | Miễn phí |
| OpenAI (key của bạn) | OpenAI | Tính vào hóa đơn OpenAI của bạn: gpt-transcribe giá $0.0045/phút (khoảng $0.27/giờ) |
| Tương thích OpenAI (GPU tự host, Groq, v.v.) | Base URL của endpoint của bạn | Tùy endpoint |
Cài đặt → Chuyển văn bản → Ngôn ngữ: Tự động, Tiếng Nhật hoặc Tiếng Anh. Đây là ngôn ngữ nói, tách biệt với ngôn ngữ giao diện.
#Whisper trên máy (miễn phí)
Chuyển văn bản trên máy dùng whisper.cpp (mở trong tab mới): tệp thực thi whisper-cli cùng một model GGML.
1. Cài whisper-cli. Ferret tìm bản đi kèm (resources/whisper/<platform>-<arch>/), sau đó trong PATH, rồi đến các vị trí thường gặp như Homebrew.
# macOS
brew install whisper-cpp
# Linux: build from source, then add build/bin to PATH
git clone https://github.com/ggml-org/whisper.cpp && cd whisper.cpp
cmake -B build && cmake --build build -j --config Release
# Windows: download the zip from github.com/ggml-org/whisper.cpp/releases
# and add the folder containing whisper-cli.exe to PATH
2. Lấy model. Khi đã chọn Trên máy (miễn phí), chọn một Model và nhấn Tải model. Tệp được tải thẳng từ Hugging Face (ggerganov/whisper.cpp), được kiểm tra với sha256 cố định trong ứng dụng (nếu không khớp, tệp bị xóa), và được lưu vào <userData>/models/. Model đã tải được tự động chọn. Hủy giữ lại tệp tải dở, và Tiếp tục tải sẽ tải tiếp từ đó.
| Model | Kích thước | Ghi chú |
|---|---|---|
large-v3-turbo | 1.6 GB | Mặc định được khuyên dùng. Nhanh trên Metal / GPU |
large-v3-turbo-q5_0 | 574 MB | Đã lượng tử hóa. Tiết kiệm ổ đĩa và bộ nhớ |
small | 488 MB | Cho máy chỉ có CPU |
base | 148 MB | Nhẹ. Nhiều lỗi với tiếng Nhật |
tiny | 78 MB | Nhanh nhất. Không đủ chính xác cho tiếng Nhật |
Đã có sẵn model? Dùng Chọn tệp… để trỏ đến bất kỳ tệp ggml-*.bin nào. Khi chưa có model, Cài đặt sẽ báo chưa đặt model. Bạn vẫn có thể ghi: âm thanh được lưu, và chỉ các góp ý bằng bút được tạo ra.
whisper-cli không đi kèm ứng dụng. Hãy tự cài như hướng dẫn ở trên. Khi không tìm thấy nó, Cài đặt hiển thị Không tìm thấy whisper.cpp (whisper-cli). Hãy cài đặt, rồi mở lại cài đặt.
cùng với hướng dẫn tương tự.
#OpenAI key của riêng bạn
- Đặt Engine thành OpenAI (key của bạn).
- Dán key bắt đầu bằng
sk-vào OpenAI API key và nhấn Lưu. - Nhấn Kiểm tra kết nối. Thao tác này gửi 1 giây im lặng (khoảng $0.0001).
Model cố định là gpt-transcribe. Chỉ khi phát triển (pnpm dev), OPENAI_API_KEY trong tệp .env (đã bị git bỏ qua) cũng được đọc. Bản build đóng gói không bao giờ đọc .env.
#Endpoint tương thích OpenAI
Ferret gửi POST <base>/v1/audio/transcriptions (multipart: file, model, response_format=json, language, prompt), nên được thiết kế cho các server có triển khai route chuyển văn bản của OpenAI.
- Đặt Engine thành Tương thích OpenAI (GPU tự host, Groq, v.v.).
- Điền Base URL của endpoint và Model (tên model của endpoint).
- Nếu server yêu cầu, nhập API key của endpoint (không bắt buộc) và nhấn Lưu.
- Nhấn Kiểm tra kết nối. Thông báo lỗi nêu rõ nguyên nhân, ví dụ Base URL sai (không có
/v1/audio/transcriptions), key bị từ chối, hoặc tên model không xác định.
| Server | Base URL | Model (ví dụ) |
|---|---|---|
| speaches (mở trong tab mới) (trước đây là faster-whisper-server) | http://localhost:8000/v1 | Systran/faster-whisper-small |
vLLM (mở trong tab mới) (vllm serve openai/whisper-large-v3) | http://localhost:8000/v1 | openai/whisper-large-v3 |
| Groq (mở trong tab mới) | https://api.groq.com/openai/v1 | whisper-large-v3-turbo |
Ferret được thiết kế cho các server tương thích OpenAI như trên, nhưng chúng chưa được kiểm thử với Ferret. URL và tên model là giá trị mặc định do chính các server đó công bố trong tài liệu.
/v1ở cuối hoặc/v1/audio/transcriptionsđược dán vào sẽ bị cắt bỏ khi lưu, nên dạng nào cũng dùng được.- URL chứa tên người dùng hoặc mật khẩu bị từ chối, để key không bao giờ lọt vào
settings.json. - Với máy GPU trong mạng LAN hoặc tailnet của bạn, dùng địa chỉ của nó, ví dụ
http://100.x.y.z:8000/v1.
#Giới hạn chi phí
Với OpenAI và endpoint tương thích, đặt Giới hạn chi phí: Không, hoặc từ Tối đa $0.10 mỗi review đến $0.50, $1 (mặc định), $5 và $20. Với GPU của riêng bạn, chọn Không là hợp lý. Thiết lập được lưu dưới dạng capture.costLimitUsd (tối đa 1000, null nghĩa là không giới hạn). Endpoint tương thích được ước tính ở mức $0.006/phút.
Khi đoạn âm thanh tiếp theo sẽ vượt giới hạn, Ferret ngừng gửi và giữ lại âm thanh. Các lệnh gọi API thất bại không được tự động thử lại.
#Key được lưu ở đâu
Key nhập trong Cài đặt được mã hóa bằng Electron safeStorage và ghi vào <userData>/stt-keys.bin. Ứng dụng không bao giờ ghi chúng vào settings.json. Để trỏ đến key từ settings.json thay vào đó (một biến môi trường hoặc mục trong .env), xem API key.
- macOS: Keychain
- Windows: DPAPI
- Linux: libsecret hoặc KWallet. Nếu chỉ có backend
basic_text, key chỉ được giữ trong bộ nhớ cho phiên hiện tại (nút sẽ hiển thị Đặt cho phiên này).
Xóa key sẽ xóa key đó. Về các đường dẫn <userData>, xem Tệp và môi trường.