English
Applied AI · Intermédiaire 🟡 · Session 8
❓ Quiz interactif
← Retour au programme 📄 Source .md

Quiz — Session 8 : Infrastructure & Déploiement

Programme : Applied AI — Niveau Intermédiaire — Instructeur : Yann Isola Format : 14 QCM (questionnaire à choix multiples) — une seule bonne réponse par question — durée conseillée : 12 minutes.


Question 1 — Quelle est la différence essentielle entre un prototype en notebook et un service en production ?

Question 2 — Pourquoi ne faut-il JAMAIS placer une clé API dans le code côté client (navigateur, application mobile) ?

Question 3 — Votre application reçoit une réponse HTTP 429 (Too Many Requests). Quelle est la bonne réaction ?

Question 4 — Quelle catégorie d’erreurs ne doit-on PAS réessayer automatiquement ?

Question 5 — Pourquoi le streaming via SSE (Server-Sent Events, événements envoyés par le serveur) améliore-t-il l’expérience utilisateur ?

Question 6 — Comment le prompt caching (mise en cache du prompt) permet-il des économies pouvant atteindre ~90 % ⚠ sur la partie cachée ?

Question 7 — Qu’est-ce que le routage de modèles (model routing) ?

Question 8 — Pourquoi surveille-t-on la latence en percentiles (p50, p95, p99) plutôt qu’en moyenne ?

Question 9 — Que signifie « les prompts sont du code » en pratique ?

Question 10 — Vous devez résumer 50 000 documents chaque nuit, sans humain devant l’écran, avec un rate limit fournisseur de 500 requêtes/minute ⚠. Quelle architecture choisir ?

Question 11 — Qu’est-ce que la quantization d’un modèle, et à quoi sert-elle ?

Question 12 — Vous devez auto-héberger un modèle open-weights de 70 milliards de paramètres (souveraineté des données) sur deux cartes de 24 Go de VRAM. En FP16 il pèse ≈ 140 Go. Quelle approche est la plus raisonnable ?

Question 13 — Dans une architecture IA d’entreprise, que signifie réellement Zero Data Retention (ZDR) ?

Question 14 — Pour une charge de travail contenant des secrets industriels critiques, quelle option offre l’assurance structurelle la plus forte ?