Configurazione
Trascrizione e costi
Scegli whisper sul dispositivo (gratuito), la tua chiave OpenAI oppure qualsiasi endpoint compatibile con OpenAI, come la tua macchina con GPU. L'audio va direttamente dal tuo computer al servizio che scegli.
#Chi paga e dove va il traffico
Modello di costi e di rete
- Lo sviluppatore (Japan Marketing LLC) non paga, non fa da proxy e non fattura alcun utilizzo di trascrizione o IA.
- Le richieste vanno direttamente dal tuo computer a OpenAI o al tuo endpoint, mai attraverso un server dello sviluppatore.
- L'utilizzo di OpenAI è addebitato sul tuo account OpenAI.
- Organizza usa la CLI di Claude Code / Codex a cui hai già effettuato l'accesso, a meno che tu non scelga esplicitamente un runner API (
organizer.runner: "api:<provider>", vedi Configurare con settings.json). Non passa mai da solo a una chiave API.
#Metodi
Scegli in Impostazioni → Trascrizione → Motore. Il popover Microfono e trascrizione del footer mostra la scelta attuale.
| Motore | Dove va l'audio | Costo |
|---|---|---|
| Sul dispositivo (gratuito) (predefinito) | Da nessuna parte | Gratuito |
| OpenAI (la tua chiave) | OpenAI | Sulla tua fattura OpenAI: gpt-transcribe a $0.0045/min (circa $0.27/ora) |
| Compatibile con OpenAI (GPU self-hosted, Groq, ecc.) | Il tuo Base URL dell'endpoint | Dipende dall'endpoint |
Impostazioni → Trascrizione → Lingua: Automatica, Giapponese o Inglese. È la lingua parlata, distinta dalla lingua dell'interfaccia.
#Whisper sul dispositivo (gratuito)
La trascrizione sul dispositivo usa whisper.cpp (si apre in una nuova scheda): il binario whisper-cli più un modello GGML.
1. Installa whisper-cli. Ferret cerca una copia inclusa (resources/whisper/<platform>-<arch>/), poi nel PATH, poi in percorsi comuni come quelli di Homebrew.
# macOS
brew install whisper-cpp
# Linux: build from source, then add build/bin to PATH
git clone https://github.com/ggml-org/whisper.cpp && cd whisper.cpp
cmake -B build && cmake --build build -j --config Release
# Windows: download the zip from github.com/ggml-org/whisper.cpp/releases
# and add the folder containing whisper-cli.exe to PATH
2. Procurati un modello. Con Sul dispositivo (gratuito) selezionato, scegli un Modello e fai clic su Scarica modello. I file arrivano direttamente da Hugging Face (ggerganov/whisper.cpp), vengono confrontati con uno sha256 fissato nell'app (in caso di mancata corrispondenza il file viene eliminato) e salvati in <userData>/models/. Il modello scaricato viene selezionato automaticamente. Annulla conserva il file parziale, e Riprendi download riparte da lì.
| Modello | Dimensione | Note |
|---|---|---|
large-v3-turbo | 1.6 GB | Predefinito consigliato. Veloce su Metal / GPU |
large-v3-turbo-q5_0 | 574 MB | Quantizzato. Risparmia disco e memoria |
small | 488 MB | Per macchine con sola CPU |
base | 148 MB | Leggero. Molti errori in giapponese |
tiny | 78 MB | Il più veloce. Non abbastanza preciso per il giapponese |
Hai già un modello? Usa Scegli un file… per indicare un qualsiasi ggml-*.bin. Senza un modello, le Impostazioni indicano che non è impostato alcun modello. Puoi comunque registrare: l'audio viene salvato e vengono prodotte solo le segnalazioni della penna.
whisper-cli non è incluso nell'app. Installalo tu come mostrato sopra. Quando non viene trovato, le Impostazioni mostrano whisper.cpp (whisper-cli) non trovato. Installalo, poi riapri le impostazioni.
con le stesse istruzioni.
#La tua chiave OpenAI
- Imposta Motore su OpenAI (la tua chiave).
- Incolla una chiave che inizia con
sk-in Chiave API OpenAI e fai clic su Salva. - Fai clic su Verifica connessione. Invia 1 secondo di silenzio (circa $0.0001).
Il modello è fisso su gpt-transcribe. Solo in sviluppo (pnpm dev) viene letto anche OPENAI_API_KEY da un file .env ignorato da git. Le build pacchettizzate non leggono mai .env.
#Endpoint compatibili con OpenAI
Ferret invia POST <base>/v1/audio/transcriptions (multipart: file, model, response_format=json, language, prompt), quindi è pensato per server che implementano la route di trascrizione di OpenAI.
- Imposta Motore su Compatibile con OpenAI (GPU self-hosted, Groq, ecc.).
- Compila Base URL dell'endpoint e Modello (il nome del modello dell'endpoint).
- Se il server la richiede, inserisci la Chiave API dell'endpoint (facoltativa) e fai clic su Salva.
- Fai clic su Verifica connessione. Gli errori indicano la causa, ad es. un Base URL errato (senza
/v1/audio/transcriptions), una chiave rifiutata o un nome di modello sconosciuto.
| Server | Base URL | Modello (esempio) |
|---|---|---|
| speaches (si apre in una nuova scheda) (in precedenza faster-whisper-server) | http://localhost:8000/v1 | Systran/faster-whisper-small |
vLLM (si apre in una nuova scheda) (vllm serve openai/whisper-large-v3) | http://localhost:8000/v1 | openai/whisper-large-v3 |
| Groq (si apre in una nuova scheda) | https://api.groq.com/openai/v1 | whisper-large-v3-turbo |
Ferret è pensato per server compatibili con OpenAI come questi, ma non sono ancora stati testati con Ferret. Gli URL e i nomi dei modelli sono i valori predefiniti documentati dai server stessi.
- Un
/v1finale o un/v1/audio/transcriptionsincollato vengono rimossi al salvataggio, quindi funzionano entrambe le forme. - Gli URL che contengono un nome utente o una password vengono rifiutati, così le chiavi non finiscono mai in
settings.json. - Per una macchina con GPU nella tua LAN o tailnet, usa il suo indirizzo, ad es.
http://100.x.y.z:8000/v1.
#Limite di spesa
Per OpenAI e gli endpoint compatibili, imposta Limite di spesa: Nessuno, oppure da Fino a $0.10 per revisione passando per $0.50, $1 (predefinito), $5 e $20. Per una tua GPU ha senso Nessuno. L'impostazione è memorizzata come capture.costLimitUsd (massimo 1000, null significa nessun limite). Per gli endpoint compatibili la stima è di $0.006/min.
Quando il blocco successivo supererebbe il limite, Ferret smette di inviare e conserva l'audio. Le chiamate API non riuscite non vengono ritentate automaticamente.
#Dove sono memorizzate le chiavi
Le chiavi inserite nelle Impostazioni sono cifrate con safeStorage di Electron e scritte in <userData>/stt-keys.bin. L'app non le scrive mai in settings.json. Per fare invece riferimento a una chiave da settings.json (una variabile d'ambiente o una voce di .env), vedi Chiavi API.
- macOS: Portachiavi
- Windows: DPAPI
- Linux: libsecret o KWallet. Se è disponibile solo il backend
basic_text, la chiave viene tenuta in memoria solo per la sessione corrente (il pulsante indica Imposta per questa sessione).
Elimina chiave la rimuove. Per i percorsi di <userData>, vedi File e ambiente.
Aiuta a tradurre questa pagina su GitHub (si apre in una nuova scheda)