Configuration

Transcription et coûts

Choisissez whisper sur l'appareil (gratuit), votre propre clé OpenAI ou n'importe quel endpoint compatible OpenAI, par exemple votre propre machine à GPU. L'audio part directement de votre machine vers le service choisi.

#Qui paie, et où passe le trafic

Modèle de coûts et de réseau

  • Le développeur (Japan Marketing LLC) ne paie, ne relaie ni ne facture aucune utilisation de transcription ou d'IA.
  • Les requêtes partent directement de votre ordinateur vers OpenAI ou votre endpoint, jamais par un serveur du développeur.
  • L'utilisation d'OpenAI est facturée sur votre propre compte OpenAI.
  • Organiser utilise la CLI Claude Code / Codex à laquelle vous êtes déjà connecté, sauf si vous choisissez explicitement un exécuteur API (organizer.runner: "api:<provider>", voir Configurer avec settings.json). Il ne bascule jamais de lui-même vers une clé d'API.

#Méthodes

Faites votre choix dans Réglages → Transcription → Moteur. La fenêtre Microphone et transcription du pied de page affiche le choix actuel.

MoteurL'audio est envoyé àCoût
Sur l'appareil (gratuit) (par défaut)Nulle partGratuit
OpenAI (votre clé)OpenAIVotre facture OpenAI : gpt-transcribe à 0,0045 $/min (environ 0,27 $/heure)
Compatible OpenAI (GPU auto-hébergé, Groq, etc.)Votre Base URL de l'endpointDépend de l'endpoint

Réglages → Transcription → Langue : Auto, Japonais ou Anglais. Il s'agit de la langue parlée, distincte de la langue de l'interface.

#whisper sur l'appareil (gratuit)

La transcription sur l'appareil utilise whisper.cpp (s'ouvre dans un nouvel onglet) : le binaire whisper-cli plus un modèle GGML.

1. Installer whisper-cli. Ferret cherche une copie fournie avec l'application (resources/whisper/<platform>-<arch>/), puis dans le PATH, puis dans les emplacements courants comme Homebrew.

# macOS
brew install whisper-cpp

# Linux: build from source, then add build/bin to PATH
git clone https://github.com/ggml-org/whisper.cpp && cd whisper.cpp
cmake -B build && cmake --build build -j --config Release

# Windows: download the zip from github.com/ggml-org/whisper.cpp/releases
# and add the folder containing whisper-cli.exe to PATH

2. Obtenir un modèle. Avec Sur l'appareil (gratuit) sélectionné, choisissez un Modèle et cliquez sur Télécharger le modèle. Les fichiers viennent directement de Hugging Face (ggerganov/whisper.cpp), sont vérifiés par rapport à un sha256 figé dans l'application (en cas de différence, le fichier est supprimé) et sont enregistrés dans <userData>/models/. Le modèle téléchargé est sélectionné automatiquement. Annuler conserve le fichier partiel, et Reprendre le téléchargement repart de là.

ModèleTailleRemarques
large-v3-turbo1,6 GoChoix par défaut recommandé. Rapide avec Metal / GPU
large-v3-turbo-q5_0574 MoQuantifié. Économise disque et mémoire
small488 MoPour les machines sans GPU
base148 MoLéger. Beaucoup d'erreurs en japonais
tiny78 MoLe plus rapide. Pas assez précis pour le japonais

Vous avez déjà un modèle ? Utilisez Choisir un fichier… pour indiquer n'importe quel ggml-*.bin. Sans modèle, les réglages indiquent qu'aucun modèle n'est défini. Vous pouvez quand même enregistrer : l'audio est conservé, et seules les remarques au stylo sont produites.

whisper-cli n'est pas fourni avec l'application. Installez-le vous-même comme indiqué ci-dessus. S'il est introuvable, les réglages affichent whisper.cpp (whisper-cli) est introuvable. Installez-le, puis rouvrez les réglages. avec les mêmes instructions.

#Votre propre clé OpenAI

  1. Réglez Moteur sur OpenAI (votre clé).
  2. Collez une clé commençant par sk- dans Clé d'API OpenAI et cliquez sur Enregistrer.
  3. Cliquez sur Tester la connexion. Ferret envoie 1 seconde de silence (environ 0,0001 $).

Le modèle est fixé à gpt-transcribe. En développement (pnpm dev) uniquement, OPENAI_API_KEY est aussi lue depuis un fichier .env ignoré par git. Les versions empaquetées ne lisent jamais .env.

#Endpoints compatibles OpenAI

Ferret envoie POST <base>/v1/audio/transcriptions (multipart : file, model, response_format=json, language, prompt) : il est donc conçu pour les serveurs qui implémentent la route de transcription d'OpenAI.

  1. Réglez Moteur sur Compatible OpenAI (GPU auto-hébergé, Groq, etc.).
  2. Renseignez Base URL de l'endpoint et Modèle (le nom du modèle côté endpoint).
  3. Si le serveur en demande une, saisissez Clé d'API de l'endpoint (facultative) et cliquez sur Enregistrer.
  4. Cliquez sur Tester la connexion. Les erreurs indiquent la cause, par exemple une Base URL incorrecte (pas de /v1/audio/transcriptions), une clé refusée ou un nom de modèle inconnu.
ServeurBase URLModèle (exemple)
speaches (s'ouvre dans un nouvel onglet) (anciennement faster-whisper-server)http://localhost:8000/v1Systran/faster-whisper-small
vLLM (s'ouvre dans un nouvel onglet) (vllm serve openai/whisper-large-v3)http://localhost:8000/v1openai/whisper-large-v3
Groq (s'ouvre dans un nouvel onglet)https://api.groq.com/openai/v1whisper-large-v3-turbo

Ferret est conçu pour des serveurs compatibles OpenAI comme ceux-ci, mais ils n'ont pas encore été testés avec Ferret. Les URL et les noms de modèles sont les valeurs par défaut documentées par les serveurs eux-mêmes.

  • Un /v1 final ou un /v1/audio/transcriptions collé est retiré à l'enregistrement : les deux formes fonctionnent.
  • Les URL contenant un nom d'utilisateur ou un mot de passe sont refusées, pour que les clés ne se retrouvent jamais dans settings.json.
  • Pour une machine à GPU sur votre réseau local ou votre tailnet, utilisez son adresse, par exemple http://100.x.y.z:8000/v1.

#Plafond de coût

Pour OpenAI et les endpoints compatibles, réglez Plafond de coût : Aucun, ou de Jusqu'à $0.10 par relecture à 0,50 $, 1 $ (par défaut), 5 $ et 20 $. Pour votre propre GPU, Aucun est logique. Le réglage est stocké sous capture.costLimitUsd (1000 au maximum, null signifie aucun plafond). Les endpoints compatibles sont estimés à 0,006 $/min.

Lorsque le segment suivant dépasserait le plafond, Ferret arrête l'envoi et conserve l'audio. Les appels d'API en échec ne sont pas relancés automatiquement.

#Où les clés sont stockées

Les clés saisies dans les Réglages sont chiffrées avec safeStorage d'Electron et écrites dans <userData>/stt-keys.bin. L'application ne les écrit jamais dans settings.json. Pour désigner plutôt une clé depuis settings.json (une variable d'environnement ou une entrée .env), voir Clés d'API.

  • macOS : Trousseau
  • Windows : DPAPI
  • Linux : libsecret ou KWallet. Si seul le backend basic_text est disponible, la clé n'est conservée en mémoire que pour la session en cours (le bouton indique Définir pour cette session).

Supprimer la clé la supprime. Pour les chemins de <userData>, voir Fichiers et environnement.

Aider à traduire cette page sur GitHub (s'ouvre dans un nouvel onglet)