Cấu hình

Chuyển văn bản và chi phí

Chọn whisper chạy trên máy (miễn phí), OpenAI key của riêng bạn, hoặc bất kỳ endpoint tương thích OpenAI nào, chẳng hạn máy GPU của riêng bạn. Âm thanh đi thẳng từ máy của bạn đến dịch vụ bạn chọn.

#Ai trả tiền, và dữ liệu đi đâu

Mô hình chi phí và mạng

  • Nhà phát triển (Japan Marketing LLC) không trả tiền, không làm proxy và không tính phí cho bất kỳ việc chuyển văn bản hay sử dụng AI nào.
  • Request đi thẳng từ máy tính của bạn đến OpenAI hoặc endpoint của bạn, không bao giờ qua server của nhà phát triển.
  • Chi phí OpenAI được tính vào tài khoản OpenAI của chính bạn.
  • Sắp xếp dùng Claude Code / Codex CLI mà bạn đã đăng nhập, trừ khi bạn chủ động chọn một API runner (organizer.runner: "api:<provider>", xem Cấu hình bằng settings.json). Nó không bao giờ tự chuyển sang dùng API key.

#Các phương thức

Chọn trong Cài đặt → Chuyển văn bản → Engine. Popover Microphone & chuyển văn bản ở footer hiển thị lựa chọn hiện tại.

EngineÂm thanh được gửi đếnChi phí
Trên máy (miễn phí) (mặc định)Không đi đâu cảMiễn phí
OpenAI (key của bạn)OpenAITính vào hóa đơn OpenAI của bạn: gpt-transcribe giá $0.0045/phút (khoảng $0.27/giờ)
Tương thích OpenAI (GPU tự host, Groq, v.v.)Base URL của endpoint của bạnTùy endpoint

Cài đặt → Chuyển văn bản → Ngôn ngữ: Tự động, Tiếng Nhật hoặc Tiếng Anh. Đây là ngôn ngữ nói, tách biệt với ngôn ngữ giao diện.

#Whisper trên máy (miễn phí)

Chuyển văn bản trên máy dùng whisper.cpp (mở trong tab mới): tệp thực thi whisper-cli cùng một model GGML.

1. Cài whisper-cli. Ferret tìm bản đi kèm (resources/whisper/<platform>-<arch>/), sau đó trong PATH, rồi đến các vị trí thường gặp như Homebrew.

# macOS
brew install whisper-cpp

# Linux: build from source, then add build/bin to PATH
git clone https://github.com/ggml-org/whisper.cpp && cd whisper.cpp
cmake -B build && cmake --build build -j --config Release

# Windows: download the zip from github.com/ggml-org/whisper.cpp/releases
# and add the folder containing whisper-cli.exe to PATH

2. Lấy model. Khi đã chọn Trên máy (miễn phí), chọn một Model và nhấn Tải model. Tệp được tải thẳng từ Hugging Face (ggerganov/whisper.cpp), được kiểm tra với sha256 cố định trong ứng dụng (nếu không khớp, tệp bị xóa), và được lưu vào <userData>/models/. Model đã tải được tự động chọn. Hủy giữ lại tệp tải dở, và Tiếp tục tải sẽ tải tiếp từ đó.

ModelKích thướcGhi chú
large-v3-turbo1.6 GBMặc định được khuyên dùng. Nhanh trên Metal / GPU
large-v3-turbo-q5_0574 MBĐã lượng tử hóa. Tiết kiệm ổ đĩa và bộ nhớ
small488 MBCho máy chỉ có CPU
base148 MBNhẹ. Nhiều lỗi với tiếng Nhật
tiny78 MBNhanh nhất. Không đủ chính xác cho tiếng Nhật

Đã có sẵn model? Dùng Chọn tệp… để trỏ đến bất kỳ tệp ggml-*.bin nào. Khi chưa có model, Cài đặt sẽ báo chưa đặt model. Bạn vẫn có thể ghi: âm thanh được lưu, và chỉ các góp ý bằng bút được tạo ra.

whisper-cli không đi kèm ứng dụng. Hãy tự cài như hướng dẫn ở trên. Khi không tìm thấy nó, Cài đặt hiển thị Không tìm thấy whisper.cpp (whisper-cli). Hãy cài đặt, rồi mở lại cài đặt. cùng với hướng dẫn tương tự.

#OpenAI key của riêng bạn

  1. Đặt Engine thành OpenAI (key của bạn).
  2. Dán key bắt đầu bằng sk- vào OpenAI API key và nhấn Lưu.
  3. Nhấn Kiểm tra kết nối. Thao tác này gửi 1 giây im lặng (khoảng $0.0001).

Model cố định là gpt-transcribe. Chỉ khi phát triển (pnpm dev), OPENAI_API_KEY trong tệp .env (đã bị git bỏ qua) cũng được đọc. Bản build đóng gói không bao giờ đọc .env.

#Endpoint tương thích OpenAI

Ferret gửi POST <base>/v1/audio/transcriptions (multipart: file, model, response_format=json, language, prompt), nên được thiết kế cho các server có triển khai route chuyển văn bản của OpenAI.

  1. Đặt Engine thành Tương thích OpenAI (GPU tự host, Groq, v.v.).
  2. Điền Base URL của endpoint và Model (tên model của endpoint).
  3. Nếu server yêu cầu, nhập API key của endpoint (không bắt buộc) và nhấn Lưu.
  4. Nhấn Kiểm tra kết nối. Thông báo lỗi nêu rõ nguyên nhân, ví dụ Base URL sai (không có /v1/audio/transcriptions), key bị từ chối, hoặc tên model không xác định.
ServerBase URLModel (ví dụ)
speaches (mở trong tab mới) (trước đây là faster-whisper-server)http://localhost:8000/v1Systran/faster-whisper-small
vLLM (mở trong tab mới) (vllm serve openai/whisper-large-v3)http://localhost:8000/v1openai/whisper-large-v3
Groq (mở trong tab mới)https://api.groq.com/openai/v1whisper-large-v3-turbo

Ferret được thiết kế cho các server tương thích OpenAI như trên, nhưng chúng chưa được kiểm thử với Ferret. URL và tên model là giá trị mặc định do chính các server đó công bố trong tài liệu.

  • /v1 ở cuối hoặc /v1/audio/transcriptions được dán vào sẽ bị cắt bỏ khi lưu, nên dạng nào cũng dùng được.
  • URL chứa tên người dùng hoặc mật khẩu bị từ chối, để key không bao giờ lọt vào settings.json.
  • Với máy GPU trong mạng LAN hoặc tailnet của bạn, dùng địa chỉ của nó, ví dụ http://100.x.y.z:8000/v1.

#Giới hạn chi phí

Với OpenAI và endpoint tương thích, đặt Giới hạn chi phí: Không, hoặc từ Tối đa $0.10 mỗi review đến $0.50, $1 (mặc định), $5 và $20. Với GPU của riêng bạn, chọn Không là hợp lý. Thiết lập được lưu dưới dạng capture.costLimitUsd (tối đa 1000, null nghĩa là không giới hạn). Endpoint tương thích được ước tính ở mức $0.006/phút.

Khi đoạn âm thanh tiếp theo sẽ vượt giới hạn, Ferret ngừng gửi và giữ lại âm thanh. Các lệnh gọi API thất bại không được tự động thử lại.

#Key được lưu ở đâu

Key nhập trong Cài đặt được mã hóa bằng Electron safeStorage và ghi vào <userData>/stt-keys.bin. Ứng dụng không bao giờ ghi chúng vào settings.json. Để trỏ đến key từ settings.json thay vào đó (một biến môi trường hoặc mục trong .env), xem API key.

  • macOS: Keychain
  • Windows: DPAPI
  • Linux: libsecret hoặc KWallet. Nếu chỉ có backend basic_text, key chỉ được giữ trong bộ nhớ cho phiên hiện tại (nút sẽ hiển thị Đặt cho phiên này).

Xóa key sẽ xóa key đó. Về các đường dẫn <userData>, xem Tệp và môi trường.

Giúp dịch trang này trên GitHub (mở trong tab mới)