Qu'est-ce qu'un SLA ?
Un SLA est un engagement contractuel sur la qualité d'un service, exprimé en indicateurs mesurables et assorti de conséquences si ces niveaux ne sont pas atteints.
Le sigle vient de l'anglais « Service Level Agreement ». L'Office québécois de la langue française propose « contrat de niveau de service » ou « accord de niveau de service ». Sa fiche le définit comme un contrat entre un prestataire et un client qui formalise les objectifs de service, prévoit des mécanismes pour en mesurer l'atteinte et définit les recours en cas de non-respect. Le SLA figure souvent en annexe d'un contrat d'hébergement, d'abonnement ou de maintenance.
Que contient un SLA ?
Un SLA complet dit ce qui est promis, comment on le mesure, ce qui est exclu et ce qui se passe en cas d'échec.
| Élément | Ce qu'il fixe | Exemple de clause |
|---|---|---|
| Disponibilité | La part du temps pendant laquelle le service fonctionne | « Application disponible 99,5 % du temps, mesuré sur le mois civil » |
| Prise en charge | Le temps entre le signalement d'un incident et le début de son traitement | « Incident bloquant pris en charge dans les 2 heures ouvrées » |
| Rétablissement | Le temps pour remettre le service en marche, même provisoirement | « Service rétabli dans les 8 heures ouvrées » |
| Exclusions | Ce qui ne compte pas comme indisponibilité | Maintenance programmée annoncée à l'avance, panne d'un service tiers |
| Conséquences | Ce que le client obtient en cas de manquement | Avoir sur facture, pénalité, droit de résilier |
Ces clauses sont des exemples fictifs : le bon niveau dépend de ce que coûte une heure d'arrêt. Le guide TMA explique comment classer les incidents par gravité.
Que signifie 99,9 % de disponibilité ?
Une disponibilité de 99,9 % signifie que le service peut être interrompu environ 43 minutes sur un mois de 30 jours, et deux taux voisins donnent des durées très différentes.
| Disponibilité promise | Arrêt toléré sur un mois de 30 jours | Arrêt toléré sur une année de 365 jours |
|---|---|---|
| 99 % | 7 h 12 min | 87 h 36 min |
| 99,5 % | 3 h 36 min | 43 h 48 min |
| 99,9 % | 43 min | 8 h 46 min |
| 99,99 % | 4 min 19 s | 53 min |
La période de mesure compte autant que le pourcentage : un engagement annuel permet de concentrer les arrêts sur quelques jours. La définition de l'indisponibilité aussi : une page qui met trente secondes à s'afficher est-elle disponible ?
SLA, SLO et SLI : quelle différence ?
Le SLA est la promesse faite au client, le SLO l'objectif que se fixe l'équipe et le SLI la mesure qui permet de vérifier les deux.
Le livre Site Reliability Engineering de Google en donne des définitions précises :
- SLI (Service Level Indicator) : une mesure quantitative, définie avec soin, d'un aspect du niveau de service, comme la part des requêtes traitées sans erreur.
- SLO (Service Level Objective) : une valeur cible ou une plage de valeurs pour un SLI.
- SLA (Service Level Agreement) : un contrat, explicite ou implicite, avec les utilisateurs, qui prévoit les conséquences du respect ou du non-respect des SLO qu'il contient.
Le même chapitre propose un test : demander ce qui se passe si l'objectif n'est pas atteint. Sans conséquence explicite, il s'agit presque certainement d'un SLO.
Un exemple réel : le SLA d'Amazon EC2
Le SLA public d'Amazon EC2, les serveurs virtuels d'AWS, montre comment un grand hébergeur rédige ces engagements.
- Dans sa version mise à jour le 25 mai 2022, AWS s'engage sur une disponibilité mensuelle de 99,99 % pour des instances réparties sur plusieurs zones d'une même région, et de 99,5 % pour une instance isolée.
- En cas de manquement, le client reçoit des crédits de service de 10 %, 30 % ou 100 % selon la disponibilité réellement constatée.
- Ces crédits ne sont pas automatiques : le client doit les réclamer auprès du support d'AWS.
- Sauf disposition contraire du contrat client, le texte précise qu'il fixe les seuls recours du client en cas d'indisponibilité.
Un crédit de service s'impute sur les factures suivantes, sans remboursement, et ne compense pas le chiffre d'affaires perdu pendant l'arrêt. Et une application ne peut pas promettre plus de disponibilité que l'hébergement qui la porte. Le comparatif OVHcloud, Scaleway ou AWS aide à choisir cet hébergement.
Les erreurs fréquentes avec un SLA
- Un taux sans définition : sans période de mesure ni définition de l'indisponibilité, le pourcentage ne se vérifie pas.
- Des exclusions trop larges : une maintenance programmée sans limite vide l'engagement.
- Aucun rapport mensuel : personne ne sait si le SLA est tenu, ni quoi réclamer.
- 99,99 % exigé par principe : chaque décimale suppose une architecture redondante plus coûteuse, utile seulement si l'arrêt coûte vraiment cher.
Chez YMHB Web, le périmètre de l'accompagnement après mise en service est écrit noir sur blanc.
Termes voisins du SLA
- TMA : maintenance d'une application par un prestataire, dont les délais figurent souvent dans un SLA (voir la définition de la TMA).
- SaaS : logiciel loué en ligne, dont le SLA fixe la disponibilité (voir la définition du SaaS).
- RPO et RTO : perte de données maximale admise et durée maximale de remise en route après un sinistre, souvent intégrées au SLA.
- Contrat de développement : ses clauses clés sont détaillées dans le guide contrat de développement logiciel.
Questions fréquentes
- Que veut dire SLA ?
- SLA signifie Service Level Agreement, en français accord ou contrat de niveau de service. C'est l'engagement, inscrit dans un contrat, par lequel un prestataire promet des niveaux de service mesurables (disponibilité, délais d'intervention, performance) et accepte des conséquences s'il ne les atteint pas, par exemple des avoirs sur facture, des pénalités ou un droit de résiliation pour le client.
- Quelle est la différence entre un SLA et un SLO ?
- Un SLO est un objectif de niveau de service, par exemple 99,9 % de requêtes réussies, que l'équipe se fixe sans conséquence contractuelle. Un SLA est un engagement envers le client, assorti de conséquences s'il n'est pas tenu. Le livre Site Reliability Engineering de Google propose un test simple : si rien n'est prévu quand l'objectif est manqué, il s'agit d'un SLO et non d'un SLA.
- Combien de temps d'arrêt représente 99,9 % de disponibilité ?
- Une disponibilité de 99,9 % tolère environ 43 minutes d'arrêt sur un mois de 30 jours, et environ 8 heures 46 minutes sur une année de 365 jours. À 99,5 %, l'arrêt toléré monte à 3 heures 36 minutes par mois. La période de mesure inscrite dans le SLA compte autant que le pourcentage : un engagement mensuel protège mieux le client qu'un engagement annuel.
- Que se passe-t-il si un SLA n'est pas respecté ?
- Si un SLA n'est pas respecté, le client obtient ce que le contrat prévoit : le plus souvent des crédits de service, parfois des pénalités ou un droit de résiliation au-delà d'un certain nombre de manquements. Chez certains hébergeurs, comme AWS pour Amazon EC2, ces crédits doivent être réclamés par le client. Ils réduisent les factures suivantes, rarement à hauteur des pertes subies pendant l'arrêt.
À lire aussi
- TMA (tierce maintenance applicative) : définition
- TMA : définition de la maintenance applicative
- OVHcloud, Scaleway ou AWS pour héberger une application
- Combien coûte l'hébergement d'une application ?
- Contrat de développement logiciel : les clauses clés
- Accompagnement et évolutions après la mise en service