Configuración

Transcripción y costes

Elige whisper en el dispositivo (gratis), tu propia clave de OpenAI o cualquier endpoint compatible con OpenAI, como tu propio equipo con GPU. El audio va directamente de tu máquina al servicio que elijas.

#Quién paga y adónde va el tráfico

Modelo de costes y de red

  • El desarrollador (Japan Marketing LLC) no paga, no intermedia ni factura ningún uso de transcripción ni de IA.
  • Las solicitudes van directamente de tu ordenador a OpenAI o a tu endpoint, nunca a través de un servidor del desarrollador.
  • El uso de OpenAI se factura a tu propia cuenta de OpenAI.
  • Organizar usa el CLI de Claude Code / Codex en el que ya tienes la sesión iniciada, salvo que elijas explícitamente un ejecutor por API (organizer.runner: "api:<provider>", consulta Configurar con settings.json). Nunca cambia por su cuenta a una clave de API.

#Métodos

Elige en Ajustes → Transcripción → Motor. La ventana emergente Micrófono y transcripción del pie muestra la elección actual.

MotorAdónde va el audioCoste
En el dispositivo (gratis) (predeterminado)A ningún sitioGratis
OpenAI (tu clave)OpenAITu factura de OpenAI: gpt-transcribe a $0.0045/min (unos $0.27/hora)
Compatible con OpenAI (GPU propia, Groq, etc.)Tu Base URL del endpointDepende del endpoint

Ajustes → Transcripción → Idioma: Automático, Japonés o Inglés. Es el idioma hablado, independiente del idioma de la interfaz.

#whisper en el dispositivo (gratis)

La transcripción en el dispositivo usa whisper.cpp (se abre en una pestaña nueva): el binario whisper-cli más un modelo GGML.

1. Instala whisper-cli. Ferret busca una copia incluida (resources/whisper/<platform>-<arch>/), luego en PATH y después en ubicaciones habituales como Homebrew.

# macOS
brew install whisper-cpp

# Linux: build from source, then add build/bin to PATH
git clone https://github.com/ggml-org/whisper.cpp && cd whisper.cpp
cmake -B build && cmake --build build -j --config Release

# Windows: download the zip from github.com/ggml-org/whisper.cpp/releases
# and add the folder containing whisper-cli.exe to PATH

2. Consigue un modelo. Con En el dispositivo (gratis) seleccionado, elige un Modelo y haz clic en Descargar modelo. Los archivos se descargan directamente de Hugging Face (ggerganov/whisper.cpp), se comprueban con un sha256 fijado en la app (si no coincide, el archivo se elimina) y se guardan en <userData>/models/. El modelo descargado se selecciona automáticamente. Cancelar conserva el archivo parcial y Reanudar descarga continúa desde ahí.

ModeloTamañoNotas
large-v3-turbo1.6 GBPredeterminado recomendado. Rápido con Metal / GPU
large-v3-turbo-q5_0574 MBCuantizado. Ahorra disco y memoria
small488 MBPara equipos solo con CPU
base148 MBLigero. Muchos errores en japonés
tiny78 MBEl más rápido. No es lo bastante preciso para japonés

¿Ya tienes un modelo? Usa Elegir un archivo… para apuntar a cualquier ggml-*.bin. Sin modelo, Ajustes indica que no hay ninguno configurado. Aun así puedes grabar: el audio se guarda y solo se generan los hallazgos de lápiz.

whisper-cli no viene incluido en la app. Instálalo tú como se muestra arriba. Cuando no se encuentra, Ajustes muestra No se encontró whisper.cpp (whisper-cli). Instálalo y vuelve a abrir los ajustes. con las mismas instrucciones.

#Tu propia clave de OpenAI

  1. Pon Motor en OpenAI (tu clave).
  2. Pega una clave que empiece por sk- en Clave de API de OpenAI y haz clic en Guardar.
  3. Haz clic en Probar conexión. Envía 1 segundo de silencio (unos $0.0001).

El modelo está fijado en gpt-transcribe. Solo en desarrollo (pnpm dev) también se lee OPENAI_API_KEY de un archivo .env ignorado por git. Las versiones empaquetadas nunca leen .env.

#Endpoints compatibles con OpenAI

Ferret envía POST <base>/v1/audio/transcriptions (multipart: file, model, response_format=json, language, prompt), así que está pensado para servidores que implementan la ruta de transcripción de OpenAI.

  1. Pon Motor en Compatible con OpenAI (GPU propia, Groq, etc.).
  2. Rellena Base URL del endpoint y Modelo (el nombre del modelo en el endpoint).
  3. Si el servidor la necesita, escribe la Clave de API del endpoint (opcional) y haz clic en Guardar.
  4. Haz clic en Probar conexión. Los errores indican la causa, p. ej. una Base URL incorrecta (sin /v1/audio/transcriptions), una clave rechazada o un nombre de modelo desconocido.
ServidorBase URLModelo (ejemplo)
speaches (se abre en una pestaña nueva) (antes faster-whisper-server)http://localhost:8000/v1Systran/faster-whisper-small
vLLM (se abre en una pestaña nueva) (vllm serve openai/whisper-large-v3)http://localhost:8000/v1openai/whisper-large-v3
Groq (se abre en una pestaña nueva)https://api.groq.com/openai/v1whisper-large-v3-turbo

Ferret está pensado para servidores compatibles con OpenAI como estos, pero aún no se han probado con Ferret. Las URL y los nombres de modelo son los valores predeterminados que documenta cada servidor.

  • Al guardar se elimina un /v1 final o un /v1/audio/transcriptions pegado, así que sirve cualquiera de las dos formas.
  • Se rechazan las URL que contienen un nombre de usuario o una contraseña, para que las claves nunca acaben en settings.json.
  • Para un equipo con GPU en tu LAN o tailnet, usa su dirección, p. ej. http://100.x.y.z:8000/v1.

#Límite de coste

Para OpenAI y los endpoints compatibles, define el Límite de coste: Ninguno, o Hasta $0.10 por revisión pasando por $0.50, $1 (predeterminado), $5 y $20. Para tu propia GPU tiene sentido Ninguno. El ajuste se guarda como capture.costLimitUsd (máximo 1000; null significa sin límite). Los endpoints compatibles se estiman a $0.006/min.

Cuando el siguiente fragmento superaría el límite, Ferret deja de enviar y conserva el audio. Las llamadas a la API que fallan no se reintentan automáticamente.

#Dónde se guardan las claves

Las claves introducidas en Ajustes se cifran con safeStorage de Electron y se escriben en <userData>/stt-keys.bin. La app nunca las escribe en settings.json. Para apuntar a una clave desde settings.json (una variable de entorno o una entrada de .env), consulta Claves de API.

  • macOS: Llavero (Keychain)
  • Windows: DPAPI
  • Linux: libsecret o KWallet. Si solo está disponible el backend basic_text, la clave se guarda en memoria solo durante la sesión actual (el botón dice Configurar para esta sesión).

Eliminar clave la borra. Para las rutas de <userData>, consulta Archivos y entorno.

Ayuda a traducir esta página en GitHub (se abre en una pestaña nueva)