Comment organiser vos requêtes de réseaux de neurones avec CPA Manager Plus
Lorsqu'on assemble un ensemble de plusieurs modèles de réseaux de neurones pour la production ou des outils personnels, le chaos s'installe inévitablement. Une requête est partie vers Claude, la seconde vers Gemini, la troisième a expiré chez OpenAI, et à la fin du mois vous recevez une facture d'un montant incompréhensible. Si vous utilisez déjà CLIProxyAPI (CPA) pour le routage du trafic, l'interface standard devient rapidement insuffisante.
Le projet CPA Manager Plus (CPAMP) comble cette lacune. Il s'agit d'un panneau de contrôle et d'un système d'observabilité qui se déploie sur votre propre serveur, stocke l'historique des requêtes localement, et vous aide à comprendre où les tokens sont réellement consommés.

Sous le capot
L'outil se compose de deux parties. La première est une interface web qui peut être intégrée directement dans CPA à la place du panneau par défaut. La seconde est un serveur Manager séparé en Go avec une base de données SQLite.
L'architecture est simple et ne nécessite pas d'inscriptions cloud. Le projet n'envoie aucune télémétrie à l'extérieur—tous les logs et les données de tarification des modèles sont stockés dans des fichiers locaux. Les clés d'accès sont chiffrées avant d'être écrites dans la base de données à l'aide d'une clé locale data.key.

Fonctionnalités principales du panneau
Trouver les échecs sans fuite de données
Le problème principal des agrégateurs API est qu'il est difficile de comprendre pourquoi une requête a échoué. Les logs contiennent généralement soit un désordre, soit du JSON brut avec des données utilisateur sensibles.
CPAMP extrait les données de la file d'attente CPA et les stocke dans SQLite. Vous obtenez une recherche par statut, latence, types de tokens et comptes. Les corps d'erreur sont automatiquement dépouillés des informations privées. Si vous devez transférer les logs pour le débogage vers un autre système, l'historique peut être exporté au format JSONL.
Suivi précis des coûts
Le panneau décompose les coûts par modèle, fournisseur, compte, clés API clientes et projets.
Les prix sont extraits automatiquement depuis models.dev, et en cas de problèmes, il y a des solutions de repli vers LiteLLM et OpenRouter. Si vous avez des endpoints personnalisés ou des remises d'entreprise, les prix peuvent être écrasés manuellement. L'application prend en compte les structures de tarification complexes : la différence entre les tokens d'entrée et de sortie, la mise en cache du contexte et les tokens de raisonnement.

Contrôle des comptes et automatisation des quotas
Lorsqu'on travaille avec un pool de comptes Codex et xAI, on atteint souvent les limites de la fenêtre de requêtes. CPAMP peut vérifier le statut des comptes selon un planning, lire l'état des quotas et envoyer automatiquement un compte en pause lorsqu'il approche de la limite. Si un compte tombe en panne, il passe dans une file d'attente d'actions séparée pour révision ou récupération manuelle.

Comment lancer
Le moyen le plus simple de déployer CPA et l'ensemble du gestionnaire est via Docker Compose. Créez un fichier de configuration :
services:
cli-proxy-api:
image: eceasy/cli-proxy-api:latest
restart: unless-stopped
ports:
- '8317:8317'
volumes:
- cpa-data:/app/data
cpa-manager-plus:
image: seakee/cpa-manager-plus:latest
restart: unless-stopped
ports:
- '18317:18317'
volumes:
- cpa-manager-plus-data:/data
volumes:
cpa-data:
cpa-manager-plus-data:
Démarrez les conteneurs avec la commande docker compose up -d. Après le démarrage, ouvrez l'adresse http://<host>:18317/management.html, récupérez la clé admin générée depuis les logs du conteneur cpa-manager-plus, et liez CPA via l'URL et la clé maître.
Si votre proxy fonctionne déjà séparément, le gestionnaire peut être lancé comme un conteneur autonome :
docker run -d \
--name cpa-manager-plus \
--restart unless-stopped \
-p 18317:18317 \
-v cpa-manager-plus-data:/data \
seakee/cpa-manager-plus:latest
À qui cela s'adresse
Le projet est destiné à ceux qui maintiennent leur propre passerelle de réseaux de neurones pour une équipe ou des scripts personnels. Si vous en avez assez de deviner aveuglément pourquoi un pipeline a échoué et quel collègue a brûlé toute la limite quotidienne de tokens, CPAMP résout le problème sans tracas supplémentaires avec des services de surveillance externes. La base de données se lance en quelques minutes, ne nécessite pas de configuration ClickHouse ou Grafana, et vous donne immédiatement une image claire de ce qui se passe.
Projets similaires