expira
Emploi
Formations
Entreprises
Événements
Guides
Emploi
Talents
Formations
Entreprises
Guides
Connexion
Connexion
Remote
Dev IA Paris
CDI
Stage
PO IA
Freelance
Tous les tests
LLM & GenAI
Coût et latence LLM
Optimiser un chatbot à 10 000 requêtes/jour sous contrainte P95.
0:00
Chatbot production : 10 k req/jour, budget P95 < 2 s. Quel levier apporte le meilleur ratio coût/latence ?
Utiliser le plus grand modèle disponible pour chaque requête
Router requêtes simples vers petit modèle, cache des FAQ fréquentes, embeddings batch offline
Supprimer le reranker sur toutes les requêtes RAG
Fixer max_tokens à 4096 pour des réponses plus complètes
Expliquez vos choix
(optionnel, recommandé)
Corriger