Choisir un LLM pour agent marketing en 2026 : cas CRM

Homme concentré travaillant devant un écran au bureau
Concentré sur son écran, il avance sur ses dossiers dans un bureau lumineux.

Un nouveau LLM ne rangera pas les prompts dispersés dans vos pages Notion. Si votre équipe utilise ChatGPT au feeling, changer de modèle produira surtout des sorties incohérentes plus vite. En septembre 2026, des agents savent consulter vos outils sur plusieurs tours ; le choix doit porter sur la tâche qu’ils terminent. Comparez d’abord les modèles accessibles à votre équipe, puis notez le coût par fiche CRM validée et les droits accordés aux outils. Une réponse convaincante dans le chat laisse encore ouverte la question de la fiche réellement mise à jour.

Les modèles progressent, l’agent change la mesure

Un LLM pour agent marketing peut répondre à une question. Un agent muni de tool use peut aussi consulter une base, modifier un document puis vérifier le résultat. Dans sa méthode d’évaluation des agents, Anthropic sépare le modèle du harness qui lui fournit instructions et outils. Claude Code en est un exemple. Le même modèle peut donner des résultats différents selon l’environnement dans lequel il agit.

Anthropic distingue aussi la trace des actions de l’état final. Si votre CRM passe par un serveur MCP, le guide des workflows marketing connectés par MCP présente les options hébergées et auto-hébergées. Dans votre essai, contrôlez la fiche effectivement créée et ses champs plutôt que l’annonce de réussite dans le chat. Le system prompt fixe les règles ; un serveur MCP expose les outils. Les autorisations accordées décident des opérations possibles. Pour départager 2 modèles, gardez le même environnement d’exécution.

Choisir le modèle selon la tâche confiée

Choisissez le modèle selon la tâche confiée à l’agent, plutôt que selon un classement général : un modèle brillant en rédaction peut échouer sur une mise à jour CRM fiable. Pour un agent CRM connecté aux outils intégrés, GPT-6 Sol s’utilise via l’API Responses d’OpenAI ; sa fiche technique limite le function calling dans Chat Completions au réglage reasoning_effort « none » et annonce une fenêtre de contexte de 1 050 000 tokens, avec une connaissance arrêtée au 20 avril 2026. GPT-6 Luna, disponible sous l’identifiant gpt-6-luna, partage cette même fenêtre de contexte et facture l’entrée mise en cache 0,01 $ pour un million de tokens, une remise de 90 % sur son tarif standard ; sa connaissance s’arrête au 18 mai 2026, d’après OpenAI. Il mérite un essai sur les mêmes dossiers avant de retenir Sol pour toute l’équipe. L’accès dans ChatGPT Work et Codex dépend de l’offre. Son arrivée dans Chat se fait progressivement : vérifiez l’interface de votre compte avant de documenter une procédure commune.

Pour rapprocher les formulaires des enregistrements, commencez avec le modèle que vous pouvez intégrer à votre outil. Faites-lui traiter des dossiers déjà résolus et mesurez la part de fiches dont les valeurs finales concordent avec la référence. Confiez les dossiers ambigus à un contrôle humain. Une évaluation publique, même menée sur des interactions avec des outils, ignore votre propre schéma CRM ainsi que vos permissions. Elle ne suffit donc pas à attribuer un accès en écriture lorsque les données contiennent des erreurs.

L’accès à Claude Fable 5 a varié. Selon les notes de version d’Anthropic, le modèle a été suspendu le 12 juin 2026 puis rétabli mondialement à partir du 1er juillet. Depuis le 1er septembre 2026, les notes de version annoncent Fable 5.1 ; Opus 5.5 est sorti le 22 septembre. Au 28 septembre 2026, l’aide d’Anthropic sur les offres applique les mêmes droits à Fable 5 et 5.1. Le tarif de Fable 5.1, d’après Anthropic, atteint 10 dollars en entrée et 50 dollars en sortie par million de tokens, avec une lecture de cache à 0,25 $ ; le tarif Batch, réservé à un traitement différé, coûte deux fois moins : 5 dollars en entrée et 25 dollars en sortie. Sur Max et les sièges premium Team ou Enterprise à sièges, ces modèles puisent jusqu’à 50 % de la limite hebdomadaire sans coût supplémentaire. Sur Pro et les sièges standard Team ou Enterprise à sièges, ils exigent des crédits d’usage ; sur Enterprise à l’usage et via API, le tarif API s’applique. Si une opération quotidienne dépend d’un modèle précis, inscrivez une voie de repli testée et contrôlez les conditions de l’offre utilisée en France. Un Custom GPT partagé dans l’équipe ne remplace pas cette vérification d’accès.

Sur le même lot de dossiers déjà résolus, consignez pour chaque candidat la part de fiches conformes à la référence, la facture par fiche approuvée, le temps de traitement et l’accès aux outils. La fenêtre de contexte et les tarifs d’entrée/sortie du tableau ci-dessous viennent des fiches officielles de chaque fournisseur ; la conformité des fiches, le coût réel par dossier et la latence restent à mesurer dans votre environnement, car ils dépendent de votre schéma CRM et de vos volumes. Le coût local inclut le matériel ainsi que le temps d’exploitation. Gardez les mêmes droits d’outils pour les 4 essais.

Spécifications officielles et grille à mesurer sur votre propre lot de dossiers CRM
Modèle Fenêtre de contexte Tarif entrée / sortie (par million de tokens) Accès agent Fiches conformes, coût par fiche et latence
GPT-6 Sol 1 050 000 tokens 2 $ / 10 $ (4 $ / 15 $ en contexte long) API Responses ; droits d’outils identiques À mesurer sur votre lot
GPT-6 Luna 1 050 000 tokens 0,10 $ / 0,50 $ API ; droits d’outils identiques À mesurer sur votre lot
Claude Fable 5.1 Jusqu’à 1 000 000 de tokens 10 $ / 50 $ Offres payantes selon le siège ; droits d’outils identiques À mesurer sur votre lot
Qwen3.8-27B 262 144 tokens (extensible à 1 000 000) Sans tarif au token ; coût matériel et exploitation Poids locaux ; droits d’outils identiques À mesurer sur votre lot

Le coût d’une tâche achevée

Au tarif « Standard » en contexte court, la grille officielle d’OpenAI affiche 2 dollars en entrée et 10 dollars en sortie par million de tokens pour GPT-6 Sol. GPT-6 Luna est affiché à 0,10 $ en entrée et 0,50 $ en sortie dans les mêmes conditions. En contexte long, la grille porte Sol à 4 dollars et 15 dollars ; ne comparez donc pas des tarifs pris dans 2 colonnes différentes. Ces montants correspondent au tarif API brut. Ils excluent un abonnement ChatGPT et un tarif TTC en euros pour la France. Le traitement régional, lorsqu’il est disponible, ajoute 10 % : sur une facture de 100 dollars, comptez 10 dollars de plus. La facture d’un agent augmente avec ses relances et ses appels d’outils ; son token cost par réponse peut masquer le coût d’une fiche approuvée.

Responsable relevant le coût réel d'un lot d'agents sur un écran

Une partie des entrées répétées peut bénéficier du cache. La documentation sur le cache d’OpenAI fixe à 1 024 tokens visibles le minimum admissible pour GPT-5.6 et les modèles ultérieurs. Pour GPT-6 Sol, l’entrée relue coûte 0,20 $ par million de tokens en contexte court, contre 2,50 dollars pour une écriture de cache, d’après OpenAI. Un préfixe admissible reste disponible au moins 30 minutes après sa dernière écriture ou réutilisation. Le diagnostic du tableau de bord peut signaler une modification des outils à l’origine d’un cache manqué. Placez les règles communes en début de prompt et maintenez stables les définitions des outils.

Pour décider quel modèle garder dans le workflow CRM de l’équipe, divisez la facture API par le nombre de fiches approuvées. Consignez à part le temps des corrections humaines ; un cache efficace peut coexister avec trop de reprises.

La sécurité dépend aussi du réseau autorisé

Le bac à sable se vérifie sur la machine qui exécute l’agent. Anthropic rapporte, en 2026, 3 incidents distincts après l’examen de 141 006 exécutions d’évaluation : des modèles, auxquels la consigne présentait un environnement sans Internet, ont pu atteindre de vrais systèmes parce que l’accès réseau existait en réalité. Les incidents concernaient des tests de cybersécurité et des environnements d’évaluation particuliers. Ce rapport ne mesure pas un taux général d’incident pour les agents marketing.

Pour votre agent CRM, supprimez d’abord les droits d’écriture sur la base de production dans l’environnement de test. Inspectez les connexions sortantes du conteneur et utilisez des données d’essai. Ajoutez ensuite les permissions une à une après vérification de l’état final. La consigne « n’envoie aucune donnée externe » dans le system prompt fixe une intention en langage naturel ; elle ne bloque techniquement aucune connexion sortante du conteneur. L’équipe qui se méfie après avoir vu une démonstration impeccable a raison de le faire : une démo réussie ne garantit pas l’isolement du système et ne prouve pas non plus la conformité des données qu’elle a manipulées.

Évaluer un workflow marketing sans fabriquer de benchmark

Les benchmarks LLM 2026 répondent à des questions précises. Un score sur un dépôt de code renseigne mal sur la qualité d’une synchronisation CRM. La méthode d’évaluation d’Anthropic distingue les tests de capacité, qui explorent les tâches possibles, des tests de non-régression, qui surveillent les tâches déjà réussies après un changement de modèle. Elle recommande plusieurs essais par tâche, car les réponses peuvent varier d’une exécution à l’autre.

  • Préparez des formulaires historiques anonymisés, avec les valeurs attendues dans chaque enregistrement.
  • Lancez le même lot avec chaque modèle candidat et la même connexion aux outils. Gardez les droits identiques.
  • Relevez les fiches exactes et les corrections humaines. Consignez la latence ainsi que la facture API du lot.
  • Relisez les appels d’outils quand une fiche est erronée : l’erreur peut venir de la lecture ou de l’écriture. Vérifiez aussi les données de départ ambiguës.

Si votre équipe a déjà des instructions dans un fichier CLAUDE.md, figez leur version pendant ce comparatif. Le rôle du fichier CLAUDE.md partagé en équipe mérite d’être distingué des réglages personnels et de l’historique de chaque session : ces écarts peuvent brouiller la comparaison. Avec un corpus documentaire, le RAG ajoute encore une variable : vérifiez la pièce retrouvée avant de noter la réponse. Un agent qui cite le mauvais document peut remplir les champs attendus sur un cas facile puis échouer dès que le dossier change. Conservez les dossiers difficiles dans chaque série d’essais.

Le modèle local élargit le choix

Pour tester une exécution sur votre infrastructure, les poids de Qwen3.8-27B sont téléchargeables. Sa fiche officielle décrit 27 milliards de paramètres et une context window native de 262 144 tokens, extensible jusqu’à 1 000 000 de tokens. Publiée sous licence Apache 2.0 en août 2026, cette fiche présente la version hébergée sur Qwen Cloud comme « à venir » : l’hébergement local exige donc de vérifier votre propre matériel et la disponibilité du service avant de choisir cette voie. Le réglage reasoning_effort module son raisonnement ; le mode de réflexion est actif par défaut.

Les scores publiés sur la fiche, d’après Qwen, atteignent par exemple 89,2 sur GPQA Diamond et 61,7 sur SWE-bench Pro : gardez-les comme repère externe et mesurez séparément votre propre lot. Sur votre machine, relevez la mémoire occupée et le temps d’une fiche CRM traitée ; comparez-les au coût par fiche approuvée via l’API. Exécutez la même suite de tests. Si l’exécution locale ralentit la validation des fiches ou alourdit l’exploitation, gardez l’API pour ce workflow ; sinon, soumettez le déploiement local à l’équipe qui gère les droits et les journaux.

Par quoi commencer avec votre CRM

Commencez par le modèle déjà accessible dans votre outil CRM plutôt que par le mieux classé sur un benchmark public : un connecteur existant élimine une variable d’intégration entière. Pour un budget serré et un volume modeste de dossiers, testez d’abord GPT-6 Luna via l’API Responses, son tarif d’entrée le plus bas du comparatif. Pour un volume élevé avec des exigences de contrôle sur les données, réservez un essai de Qwen3.8-27B en interne avant de l’exécuter en conteneur isolé. Mesurez sur un premier lot de 50 dossiers déjà résolus : si moins de 20 % des fiches exigent une correction humaine, généralisez le modèle retenu à l’équipe. Si l’écart de conformité entre 2 modèles reste sous 5 %, retestez sur un second lot avant de trancher ; au-delà, gardez un contrôle humain le temps d’élargir l’accès.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *