Configuration
Transcription et coûts
Choisissez whisper sur l'appareil (gratuit), votre propre clé OpenAI ou n'importe quel endpoint compatible OpenAI, par exemple votre propre machine à GPU. L'audio part directement de votre machine vers le service choisi.
#Qui paie, et où passe le trafic
Modèle de coûts et de réseau
- Le développeur (Japan Marketing LLC) ne paie, ne relaie ni ne facture aucune utilisation de transcription ou d'IA.
- Les requêtes partent directement de votre ordinateur vers OpenAI ou votre endpoint, jamais par un serveur du développeur.
- L'utilisation d'OpenAI est facturée sur votre propre compte OpenAI.
- Organiser utilise la CLI Claude Code / Codex à laquelle vous êtes déjà connecté, sauf si vous choisissez explicitement un exécuteur API (
organizer.runner: "api:<provider>", voir Configurer avec settings.json). Il ne bascule jamais de lui-même vers une clé d'API.
#Méthodes
Faites votre choix dans Réglages → Transcription → Moteur. La fenêtre Microphone et transcription du pied de page affiche le choix actuel.
| Moteur | L'audio est envoyé à | Coût |
|---|---|---|
| Sur l'appareil (gratuit) (par défaut) | Nulle part | Gratuit |
| OpenAI (votre clé) | OpenAI | Votre facture OpenAI : gpt-transcribe à 0,0045 $/min (environ 0,27 $/heure) |
| Compatible OpenAI (GPU auto-hébergé, Groq, etc.) | Votre Base URL de l'endpoint | Dépend de l'endpoint |
Réglages → Transcription → Langue : Auto, Japonais ou Anglais. Il s'agit de la langue parlée, distincte de la langue de l'interface.
#whisper sur l'appareil (gratuit)
La transcription sur l'appareil utilise whisper.cpp (s'ouvre dans un nouvel onglet) : le binaire whisper-cli plus un modèle GGML.
1. Installer whisper-cli. Ferret cherche une copie fournie avec l'application (resources/whisper/<platform>-<arch>/), puis dans le PATH, puis dans les emplacements courants comme Homebrew.
# macOS
brew install whisper-cpp
# Linux: build from source, then add build/bin to PATH
git clone https://github.com/ggml-org/whisper.cpp && cd whisper.cpp
cmake -B build && cmake --build build -j --config Release
# Windows: download the zip from github.com/ggml-org/whisper.cpp/releases
# and add the folder containing whisper-cli.exe to PATH
2. Obtenir un modèle. Avec Sur l'appareil (gratuit) sélectionné, choisissez un Modèle et cliquez sur Télécharger le modèle. Les fichiers viennent directement de Hugging Face (ggerganov/whisper.cpp), sont vérifiés par rapport à un sha256 figé dans l'application (en cas de différence, le fichier est supprimé) et sont enregistrés dans <userData>/models/. Le modèle téléchargé est sélectionné automatiquement. Annuler conserve le fichier partiel, et Reprendre le téléchargement repart de là.
| Modèle | Taille | Remarques |
|---|---|---|
large-v3-turbo | 1,6 Go | Choix par défaut recommandé. Rapide avec Metal / GPU |
large-v3-turbo-q5_0 | 574 Mo | Quantifié. Économise disque et mémoire |
small | 488 Mo | Pour les machines sans GPU |
base | 148 Mo | Léger. Beaucoup d'erreurs en japonais |
tiny | 78 Mo | Le plus rapide. Pas assez précis pour le japonais |
Vous avez déjà un modèle ? Utilisez Choisir un fichier… pour indiquer n'importe quel ggml-*.bin. Sans modèle, les réglages indiquent qu'aucun modèle n'est défini. Vous pouvez quand même enregistrer : l'audio est conservé, et seules les remarques au stylo sont produites.
whisper-cli n'est pas fourni avec l'application. Installez-le vous-même comme indiqué ci-dessus. S'il est introuvable, les réglages affichent whisper.cpp (whisper-cli) est introuvable. Installez-le, puis rouvrez les réglages.
avec les mêmes instructions.
#Votre propre clé OpenAI
- Réglez Moteur sur OpenAI (votre clé).
- Collez une clé commençant par
sk-dans Clé d'API OpenAI et cliquez sur Enregistrer. - Cliquez sur Tester la connexion. Ferret envoie 1 seconde de silence (environ 0,0001 $).
Le modèle est fixé à gpt-transcribe. En développement (pnpm dev) uniquement, OPENAI_API_KEY est aussi lue depuis un fichier .env ignoré par git. Les versions empaquetées ne lisent jamais .env.
#Endpoints compatibles OpenAI
Ferret envoie POST <base>/v1/audio/transcriptions (multipart : file, model, response_format=json, language, prompt) : il est donc conçu pour les serveurs qui implémentent la route de transcription d'OpenAI.
- Réglez Moteur sur Compatible OpenAI (GPU auto-hébergé, Groq, etc.).
- Renseignez Base URL de l'endpoint et Modèle (le nom du modèle côté endpoint).
- Si le serveur en demande une, saisissez Clé d'API de l'endpoint (facultative) et cliquez sur Enregistrer.
- Cliquez sur Tester la connexion. Les erreurs indiquent la cause, par exemple une Base URL incorrecte (pas de
/v1/audio/transcriptions), une clé refusée ou un nom de modèle inconnu.
| Serveur | Base URL | Modèle (exemple) |
|---|---|---|
| speaches (s'ouvre dans un nouvel onglet) (anciennement faster-whisper-server) | http://localhost:8000/v1 | Systran/faster-whisper-small |
vLLM (s'ouvre dans un nouvel onglet) (vllm serve openai/whisper-large-v3) | http://localhost:8000/v1 | openai/whisper-large-v3 |
| Groq (s'ouvre dans un nouvel onglet) | https://api.groq.com/openai/v1 | whisper-large-v3-turbo |
Ferret est conçu pour des serveurs compatibles OpenAI comme ceux-ci, mais ils n'ont pas encore été testés avec Ferret. Les URL et les noms de modèles sont les valeurs par défaut documentées par les serveurs eux-mêmes.
- Un
/v1final ou un/v1/audio/transcriptionscollé est retiré à l'enregistrement : les deux formes fonctionnent. - Les URL contenant un nom d'utilisateur ou un mot de passe sont refusées, pour que les clés ne se retrouvent jamais dans
settings.json. - Pour une machine à GPU sur votre réseau local ou votre tailnet, utilisez son adresse, par exemple
http://100.x.y.z:8000/v1.
#Plafond de coût
Pour OpenAI et les endpoints compatibles, réglez Plafond de coût : Aucun, ou de Jusqu'à $0.10 par relecture à 0,50 $, 1 $ (par défaut), 5 $ et 20 $. Pour votre propre GPU, Aucun est logique. Le réglage est stocké sous capture.costLimitUsd (1000 au maximum, null signifie aucun plafond). Les endpoints compatibles sont estimés à 0,006 $/min.
Lorsque le segment suivant dépasserait le plafond, Ferret arrête l'envoi et conserve l'audio. Les appels d'API en échec ne sont pas relancés automatiquement.
#Où les clés sont stockées
Les clés saisies dans les Réglages sont chiffrées avec safeStorage d'Electron et écrites dans <userData>/stt-keys.bin. L'application ne les écrit jamais dans settings.json. Pour désigner plutôt une clé depuis settings.json (une variable d'environnement ou une entrée .env), voir Clés d'API.
- macOS : Trousseau
- Windows : DPAPI
- Linux : libsecret ou KWallet. Si seul le backend
basic_textest disponible, la clé n'est conservée en mémoire que pour la session en cours (le bouton indique Définir pour cette session).
Supprimer la clé la supprime. Pour les chemins de <userData>, voir Fichiers et environnement.
Aider à traduire cette page sur GitHub (s'ouvre dans un nouvel onglet)