Configuración
Transcripción y costes
Elige whisper en el dispositivo (gratis), tu propia clave de OpenAI o cualquier endpoint compatible con OpenAI, como tu propio equipo con GPU. El audio va directamente de tu máquina al servicio que elijas.
#Quién paga y adónde va el tráfico
Modelo de costes y de red
- El desarrollador (Japan Marketing LLC) no paga, no intermedia ni factura ningún uso de transcripción ni de IA.
- Las solicitudes van directamente de tu ordenador a OpenAI o a tu endpoint, nunca a través de un servidor del desarrollador.
- El uso de OpenAI se factura a tu propia cuenta de OpenAI.
- Organizar usa el CLI de Claude Code / Codex en el que ya tienes la sesión iniciada, salvo que elijas explícitamente un ejecutor por API (
organizer.runner: "api:<provider>", consulta Configurar con settings.json). Nunca cambia por su cuenta a una clave de API.
#Métodos
Elige en Ajustes → Transcripción → Motor. La ventana emergente Micrófono y transcripción del pie muestra la elección actual.
| Motor | Adónde va el audio | Coste |
|---|---|---|
| En el dispositivo (gratis) (predeterminado) | A ningún sitio | Gratis |
| OpenAI (tu clave) | OpenAI | Tu factura de OpenAI: gpt-transcribe a $0.0045/min (unos $0.27/hora) |
| Compatible con OpenAI (GPU propia, Groq, etc.) | Tu Base URL del endpoint | Depende del endpoint |
Ajustes → Transcripción → Idioma: Automático, Japonés o Inglés. Es el idioma hablado, independiente del idioma de la interfaz.
#whisper en el dispositivo (gratis)
La transcripción en el dispositivo usa whisper.cpp (se abre en una pestaña nueva): el binario whisper-cli más un modelo GGML.
1. Instala whisper-cli. Ferret busca una copia incluida (resources/whisper/<platform>-<arch>/), luego en PATH y después en ubicaciones habituales como Homebrew.
# macOS
brew install whisper-cpp
# Linux: build from source, then add build/bin to PATH
git clone https://github.com/ggml-org/whisper.cpp && cd whisper.cpp
cmake -B build && cmake --build build -j --config Release
# Windows: download the zip from github.com/ggml-org/whisper.cpp/releases
# and add the folder containing whisper-cli.exe to PATH
2. Consigue un modelo. Con En el dispositivo (gratis) seleccionado, elige un Modelo y haz clic en Descargar modelo. Los archivos se descargan directamente de Hugging Face (ggerganov/whisper.cpp), se comprueban con un sha256 fijado en la app (si no coincide, el archivo se elimina) y se guardan en <userData>/models/. El modelo descargado se selecciona automáticamente. Cancelar conserva el archivo parcial y Reanudar descarga continúa desde ahí.
| Modelo | Tamaño | Notas |
|---|---|---|
large-v3-turbo | 1.6 GB | Predeterminado recomendado. Rápido con Metal / GPU |
large-v3-turbo-q5_0 | 574 MB | Cuantizado. Ahorra disco y memoria |
small | 488 MB | Para equipos solo con CPU |
base | 148 MB | Ligero. Muchos errores en japonés |
tiny | 78 MB | El más rápido. No es lo bastante preciso para japonés |
¿Ya tienes un modelo? Usa Elegir un archivo… para apuntar a cualquier ggml-*.bin. Sin modelo, Ajustes indica que no hay ninguno configurado. Aun así puedes grabar: el audio se guarda y solo se generan los hallazgos de lápiz.
whisper-cli no viene incluido en la app. Instálalo tú como se muestra arriba. Cuando no se encuentra, Ajustes muestra No se encontró whisper.cpp (whisper-cli). Instálalo y vuelve a abrir los ajustes.
con las mismas instrucciones.
#Tu propia clave de OpenAI
- Pon Motor en OpenAI (tu clave).
- Pega una clave que empiece por
sk-en Clave de API de OpenAI y haz clic en Guardar. - Haz clic en Probar conexión. Envía 1 segundo de silencio (unos $0.0001).
El modelo está fijado en gpt-transcribe. Solo en desarrollo (pnpm dev) también se lee OPENAI_API_KEY de un archivo .env ignorado por git. Las versiones empaquetadas nunca leen .env.
#Endpoints compatibles con OpenAI
Ferret envía POST <base>/v1/audio/transcriptions (multipart: file, model, response_format=json, language, prompt), así que está pensado para servidores que implementan la ruta de transcripción de OpenAI.
- Pon Motor en Compatible con OpenAI (GPU propia, Groq, etc.).
- Rellena Base URL del endpoint y Modelo (el nombre del modelo en el endpoint).
- Si el servidor la necesita, escribe la Clave de API del endpoint (opcional) y haz clic en Guardar.
- Haz clic en Probar conexión. Los errores indican la causa, p. ej. una Base URL incorrecta (sin
/v1/audio/transcriptions), una clave rechazada o un nombre de modelo desconocido.
| Servidor | Base URL | Modelo (ejemplo) |
|---|---|---|
| speaches (se abre en una pestaña nueva) (antes faster-whisper-server) | http://localhost:8000/v1 | Systran/faster-whisper-small |
vLLM (se abre en una pestaña nueva) (vllm serve openai/whisper-large-v3) | http://localhost:8000/v1 | openai/whisper-large-v3 |
| Groq (se abre en una pestaña nueva) | https://api.groq.com/openai/v1 | whisper-large-v3-turbo |
Ferret está pensado para servidores compatibles con OpenAI como estos, pero aún no se han probado con Ferret. Las URL y los nombres de modelo son los valores predeterminados que documenta cada servidor.
- Al guardar se elimina un
/v1final o un/v1/audio/transcriptionspegado, así que sirve cualquiera de las dos formas. - Se rechazan las URL que contienen un nombre de usuario o una contraseña, para que las claves nunca acaben en
settings.json. - Para un equipo con GPU en tu LAN o tailnet, usa su dirección, p. ej.
http://100.x.y.z:8000/v1.
#Límite de coste
Para OpenAI y los endpoints compatibles, define el Límite de coste: Ninguno, o Hasta $0.10 por revisión pasando por $0.50, $1 (predeterminado), $5 y $20. Para tu propia GPU tiene sentido Ninguno. El ajuste se guarda como capture.costLimitUsd (máximo 1000; null significa sin límite). Los endpoints compatibles se estiman a $0.006/min.
Cuando el siguiente fragmento superaría el límite, Ferret deja de enviar y conserva el audio. Las llamadas a la API que fallan no se reintentan automáticamente.
#Dónde se guardan las claves
Las claves introducidas en Ajustes se cifran con safeStorage de Electron y se escriben en <userData>/stt-keys.bin. La app nunca las escribe en settings.json. Para apuntar a una clave desde settings.json (una variable de entorno o una entrada de .env), consulta Claves de API.
- macOS: Llavero (Keychain)
- Windows: DPAPI
- Linux: libsecret o KWallet. Si solo está disponible el backend
basic_text, la clave se guarda en memoria solo durante la sesión actual (el botón dice Configurar para esta sesión).
Eliminar clave la borra. Para las rutas de <userData>, consulta Archivos y entorno.
Ayuda a traducir esta página en GitHub (se abre en una pestaña nueva)