Un cas d'usage à valider
Une idée d'assistant, de recherche documentaire ou d'automatisation existe, mais sa faisabilité, sa qualité et son coût restent à démontrer sur vos données réelles.
Expertise
Agence d'intégration IA : nous intégrons des modèles de langage (OpenAI, Anthropic, Mistral, Llama auto-hébergé) dans vos applications et vos processus, avec RAG sur vos données, agents et routage multi-modèles, en tenant qualité, coût et latence.
1// routeur.ts — illustration23export const routage = {4narration: 'modèle narratif',5actions: 'modèle instruction-tuned',6recherche: 'RAG · base vectorielle',7};89export const garde_fous = [10'cache sémantique', 'supervision humaine',11];
Situations
Une idée d'assistant, de recherche documentaire ou d'automatisation existe, mais sa faisabilité, sa qualité et son coût restent à démontrer sur vos données réelles.
La démonstration fonctionne, mais les réponses varient, la latence et la facture d'API augmentent, et personne ne sait mesurer la qualité.
Documents, catalogues ou bases internes doivent alimenter un assistant sans sortir du périmètre de confiance de l'entreprise.
La résidence des données ou la maîtrise de l'hébergement écarte certaines API et oriente vers des modèles auto-hébergés.
Périmètres couverts
De l'étude de faisabilité à l'exploitation : vous pouvez nous confier l'intégration complète ou une brique précise.
Cas d'usage, données disponibles, critères de qualité, coût par requête et place de la supervision humaine, arrêtés avant d'écrire le premier prompt.
Recherche augmentée sur vos documents et bases métier : découpage, indexation vectorielle, citation des sources et contrôle des accès.
Assistants conversationnels et agents qui appellent vos API et vos outils métier, avec des actions bornées et journalisées.
Choix du modèle selon l'intention, la qualité attendue et le coût, modèles commerciaux ou Llama auto-hébergé, cache sémantique sur les requêtes récurrentes.
Jeux de cas représentatifs, mesure de la qualité des réponses et suivi des régressions à chaque changement de modèle ou de prompt.
Intégration dans l'application mobile ou web, supervision de la latence et du coût, journalisation et procédures en cas de dérive.
Méthode
Ce que l'IA doit produire, pour qui, à partir de quelles données et avec quel niveau d'erreur acceptable. Le coût par requête et la latence visée sont posés dès cette étape.
Un prototype évalué sur un jeu de cas réels : qualité des réponses, coût et latence. La suite se décide sur ces mesures, pas sur une démonstration.
Intégration dans le produit, garde-fous, supervision humaine là où elle est nécessaire, tests et intégration continue.
Suivi de la qualité, du coût et de la latence en production, ajustement des prompts, du routage et des modèles à mesure que l'usage évolue.
Responsabilités
Répartition courante des responsabilités, arrêtée mission par mission dans le contrat.
| Sujet | Chez vous | Chez Black Tide |
|---|---|---|
| Données | Vous ouvrez l'accès aux données utiles et fixez ce qui peut en sortir | Nous travaillons dans ce périmètre et documentons les flux |
| Critères de qualité | Vous validez ce qu'est une bonne réponse | Nous construisons les jeux de cas qui la mesurent |
| Choix des modèles | Vous arbitrez entre coût, qualité et hébergement | Nous comparons les options sur vos cas réels |
| Supervision humaine | Vous décidez où une validation humaine est requise | Nous l'intégrons dans les parcours |
| Mise en production | Vous décidez de la date | Nous préparons, déployons et surveillons |
Preuve
Pipeline LLM en cascade associant un modèle narratif affiné et un modèle instruction-tuned, routeur selon l'intention et cache sémantique qui réduit de 40 % les appels API.
Lire le cas MeduzAutour de l'application de lecture, une communauté Discord dotée d'une économie virtuelle et d'un agent conversationnel relié à une base vectorielle.
Lire le cas Fantasy AlleyChaque cas décrit le travail réellement réalisé, son périmètre et son statut.
Budget et suite
Cas d'usage, données mobilisables, critères de qualité, modèles candidats et architecture cible. C'est la base du chiffrage.
Les jours de conception et d'ingénierie, la préparation des données et le niveau d'évaluation attendu, ainsi que les coûts d'API ou d'hébergement des modèles, estimés au cadrage et précisés au devis.
Le coût par requête est mesuré dès le prototype. Le routage entre modèles et le cache servent à le tenir quand l'usage augmente.
Étude de faisabilité seule, prototype mesuré, ou intégration complète dans votre produit.
Questions utiles
Cela dépend du modèle retenu et de son hébergement. Lorsque la résidence des données l'exige, nous orientons vers des modèles Llama auto-hébergés. Les flux de données sont documentés au cadrage.
Il n'y a pas de modèle unique. Nous comparons OpenAI, Anthropic, Mistral ou un modèle auto-hébergé sur vos cas réels, selon la qualité, le coût et la latence, et pouvons en combiner plusieurs.
Rarement en premier. Le RAG et un bon routage couvrent la plupart des besoins. L'affinage d'un modèle se justifie pour un style ou une tâche très spécifiques, comme le modèle narratif de Meduz.
Oui. Nous examinons d'abord l'application, ses données et ses contraintes, puis intégrons l'IA par lots sans fragiliser l'existant, en projet ou en renfort de votre équipe.
Prochaine étape
Ce que l'IA doit faire, les données disponibles et vos contraintes d'hébergement : c'est le point de départ d'un cadrage utile.