Phare, orchestration scale-to-zero sur OVH AI Deploy
Couche d'orchestration qui endort et réveille les charges IA selon la demande.
Phare est une couche d’orchestration scale-to-zero au-dessus d’OVH AI Deploy : elle endort les charges IA quand personne ne les utilise et les réveille à la première requête, pour ne payer le GPU que lorsqu’il sert.
Le problème visé est bien connu de quiconque héberge de l’inférence : un modèle servi en continu coûte le même prix à 3 h du matin qu’en pleine journée, alors que la demande réelle est intermittente. Les offres cloud facturent à l’heure d’instance, pas à l’usage utile. Sur des GPU, l’écart entre coût facturé et valeur produite devient vite déraisonnable.
Phare intercepte le trafic entrant, maintient un état des déploiements et pilote l’API OVH AI Deploy : arrêt des instances après une période d’inactivité configurable, redémarrage à la demande avec file d’attente des requêtes pendant le réveil, et remontée d’état claire pour que l’appelant sache s’il doit patienter ou réessayer.
Le résultat est une facture GPU alignée sur l’usage réel, sans modifier les applications clientes : elles continuent d’appeler le même endpoint, la mise en veille et le réveil sont transparents pour elles.