設定

轉錄與費用

可選擇本機 whisper(免費)、你自己的 OpenAI 金鑰,或任何相容 OpenAI 的端點(例如你自己的 GPU 主機)。音訊會直接從你的電腦傳送到你選擇的服務。

#誰付費,流量往哪裡去

費用與網路模型

  • 開發者(Japan Marketing LLC)不支付、不代理,也不收取任何轉錄或 AI 使用費用。
  • 請求會直接從你的電腦傳送到 OpenAI 或你的端點,絕不經過開發者的伺服器。
  • OpenAI 的用量會向你自己的 OpenAI 帳號收費。
  • 整理 會使用你已登入的 Claude Code / Codex CLI,除非你明確選擇 API 執行器(organizer.runner: "api:<provider>",請參閱用 settings.json 設定)。它絕不會自行改用 API 金鑰。

#轉錄方式

在 設定 → 轉錄 → 引擎 中選擇。頁尾的 麥克風與轉錄 彈出視窗會顯示目前的選擇。

引擎音訊送往費用
本機(免費)(預設)不傳送免費
OpenAI(你的 key)OpenAI由你的 OpenAI 帳單支付:gpt-transcribe 每分鐘 $0.0045(每小時約 $0.27)
相容 OpenAI(自架 GPU、Groq 等)你的 端點 Base URL依端點而定

設定 → 轉錄 → 語言:自動、日文 或 英文。這是你說話的語言,與介面語言是分開的。

#本機 whisper(免費)

本機轉錄使用 whisper.cpp (在新分頁中開啟):也就是 whisper-cli 執行檔加上 GGML 模型。

1. 安裝 whisper-cli。Ferret 會先尋找隨附的版本(resources/whisper/<platform>-<arch>/),接著是 PATH,再來是 Homebrew 等常見位置。

# macOS
brew install whisper-cpp

# Linux: build from source, then add build/bin to PATH
git clone https://github.com/ggml-org/whisper.cpp && cd whisper.cpp
cmake -B build && cmake --build build -j --config Release

# Windows: download the zip from github.com/ggml-org/whisper.cpp/releases
# and add the folder containing whisper-cli.exe to PATH

2. 取得模型。選擇 本機(免費) 後,挑選 模型 並按 下載模型。檔案會直接從 Hugging Face(ggerganov/whisper.cpp)下載,並以 App 內建的 sha256 檢查(不一致時會刪除檔案),儲存到 <userData>/models/。下載完成的模型會自動被選取。按 取消 會保留已下載的部分檔案,按 繼續下載 則會從中斷處繼續。

模型大小說明
large-v3-turbo1.6 GB建議的預設值。在 Metal / GPU 上速度快
large-v3-turbo-q5_0574 MB量化版本。節省磁碟空間與記憶體
small488 MB適合只有 CPU 的電腦
base148 MB輕量。日文錯誤較多
tiny78 MB最快。日文的準確度不足

已經有模型了嗎?用 選擇檔案… 指定任何 ggml-*.bin 即可。沒有模型時,設定中會顯示尚未設定模型。你仍然可以錄製:音訊會儲存,但只會產生畫筆意見。

App 並未隨附 whisper-cli。請依上述步驟自行安裝。找不到它時,設定中會顯示 找不到 whisper.cpp(whisper-cli)。請安裝後重新開啟設定。 以及相同的安裝說明。

#使用你自己的 OpenAI 金鑰

  1. 將 引擎 設為 OpenAI(你的 key)。
  2. 在 OpenAI API 金鑰 貼上以 sk- 開頭的金鑰,然後按 儲存。
  3. 按 測試連線。這會傳送 1 秒的靜音(約 $0.0001)。

模型固定為 gpt-transcribe。僅在開發環境(pnpm dev)中,也會讀取被 git 忽略的 .env 檔案中的 OPENAI_API_KEY。打包後的版本絕不會讀取 .env。

#相容 OpenAI 的端點

Ferret 會傳送 POST <base>/v1/audio/transcriptions(multipart:file、model、response_format=json、language、prompt),因此是為實作了 OpenAI 轉錄路由的伺服器而設計。

  1. 將 引擎 設為 相容 OpenAI(自架 GPU、Groq 等)。
  2. 填入 端點 Base URL 與 模型(端點上的模型名稱)。
  3. 如果伺服器需要金鑰,請輸入 Endpoint API key(選填) 並按 儲存。
  4. 按 測試連線。錯誤訊息會指出原因,例如 Base URL 錯誤(沒有 /v1/audio/transcriptions)、金鑰被拒絕,或模型名稱不明。
伺服器Base URL模型(範例)
speaches (在新分頁中開啟)(前身為 faster-whisper-server)http://localhost:8000/v1Systran/faster-whisper-small
vLLM (在新分頁中開啟)(vllm serve openai/whisper-large-v3)http://localhost:8000/v1openai/whisper-large-v3
Groq (在新分頁中開啟)https://api.groq.com/openai/v1whisper-large-v3-turbo

Ferret 是為這類相容 OpenAI 的伺服器而設計,但尚未實際與 Ferret 一起測試過。上表的 URL 與模型名稱是各伺服器文件中的預設值。

  • 儲存時會去掉結尾的 /v1 或貼上的 /v1/audio/transcriptions,因此兩種寫法都可以。
  • 含有使用者名稱或密碼的 URL 會被拒絕,所以金鑰絕不會寫進 settings.json。
  • 若是區域網路或 tailnet 上的 GPU 主機,請使用它的位址,例如 http://100.x.y.z:8000/v1。

#費用上限

使用 OpenAI 與相容端點時,可設定 費用上限:無,或從 每份審查最多 $0.10 到 $0.50、$1(預設)、$5、$20。使用你自己的 GPU 時,選 無 較合理。此設定儲存為 capture.costLimitUsd(最大 1000,null 表示沒有上限)。相容端點以每分鐘 $0.006 估算。

當下一段音訊會超過上限時,Ferret 會停止傳送並保留音訊。失敗的 API 呼叫不會自動重試。

#金鑰儲存在哪裡

在 設定 中輸入的金鑰會以 Electron safeStorage 加密,寫入 <userData>/stt-keys.bin。App 絕不會把它們寫進 settings.json。若要改從 settings.json 指向金鑰(環境變數或 .env 項目),請參閱 API 金鑰。

  • macOS:鑰匙圈(Keychain)
  • Windows:DPAPI
  • Linux:libsecret 或 KWallet。如果只能使用 basic_text 後端,金鑰只會在目前的工作階段中保存在記憶體裡(按鈕會顯示 僅於此工作階段設定)。

按 刪除 key 即可移除。<userData> 的路徑請參閱檔案與環境。

在 GitHub 上協助翻譯此頁 (在新分頁中開啟)