Agents IA Claude et recherche académique : guide pas à pas pour doctorants en sciences de gestion

Vous avez passé trois semaines à dépouiller 400 abstracts sur CAIRN et Google Scholar pour votre revue de littérature. Un agent IA aurait fait le même travail de tri préliminaire en 47 minutes. Ce n’est pas de la science-fiction : Scherbakov et al. (2025) ont montré que les LLMs atteignent une concordance de 80 à 90 % avec le screening humain dans les revues systématiques. La question n’est plus « est-ce que ça marche ? » mais « comment le construire sans formation en informatique ? »

1. Qu’est-ce qu’un agent IA ? Généalogie d’un concept

Le terme agent remonte aux travaux de Turing (1950) et à la formalisation par Russell & Norvig dans Artificial Intelligence: A Modern Approach (1995, 4e éd. 2021) : un agent perçoit son environnement via des capteurs et agit en conséquence via des effecteurs.

Chronologie des agents LLM

  • 2020 — GPT-3 ouvre la voie aux agents basés sur le langage naturel
  • 2022 — ReAct (Yao et al.) propose Reasoning + Acting
  • 2023 — AutoGPT popularise le concept ; Wang et al. publient la première revue systématique
  • 2024 — Agents spécialisés pour la recherche : Coscientist, ChemCrow
  • 2025 — Anthropic lance les Managed Agents et la fonctionnalité Research

Introduction sans jargon aux agents IAEmma, l’agente IA entrepreneuse


2. Pourquoi les doctorants ne peuvent plus ignorer les agents IA

Le nombre de publications en sciences de gestion a augmenté de 34 % entre 2019 et 2024 (OpenAlex). Une revue PRISMA mobilise 200 à 400 heures. Un agent bien configuré prend en charge 30 à 60 % des étapes mécaniques (Wang et al., 2023).

Scherbakov et al. (2025) dans JAMIA : LLMs utilisés en recherche documentaire (41 %), screening (38 %) et extraction (30 %). Un système multi-agents surpasse un agent unique de 90,2 % sur les tâches multi-sources (Anthropic, 2025).

Infobésité et décision managérialeMarché de l’édition scientifique


3. Comment fonctionne un agent IA Claude : cerveau / mains / session

  • Le cerveau (harness) : Claude décide, n’exécute pas directement.
  • Les mains (sandbox) : environnement d’exécution isolé pour la sécurité.
  • La mémoire (session log) : journal immuable permettant de reprendre une session.

Paradigme ReAct (Yao et al., 2022) : alternance raisonnement explicite / action concrète. Cette transparence permet de vérifier les décisions et d’identifier les biais de sélection.

MCP : connecter les agents à vos outilsRAG


4. Exemple : le système multi-agents d’Anthropic

Anthropic a documenté son système Research interne : sans description précise des sous-tâches, les agents dupliquent le travail. Solution : frontières de tâche explicites (objectif + format + sources + limites).

Application pour un doctorant : un agent décompose votre requête en sous-tâches parallèles (Google Scholar, SSRN, OpenAlex) puis consolide les résultats. Opérationnel avec l’API Anthropic.


5. Guide pas à pas : créer votre premier agent Claude

Prérequis

  • claude.ai (plan Pro) ou clé API Anthropic
  • pip install anthropic requests beautifulsoup4
  • export ANTHROPIC_API_KEY="votre_cle"

Étape 1 — Définir l’objectif

Trois questions : quelle tâche répétitive ? quel livrable ? quelles sources ?

Étape 2 — Définition de l’outil

tool_search = {
 "name": "search_openalex",
 "description": "Recherche articles dans OpenAlex.",
 "input_schema": {
  "type": "object",
  "properties": {
   "query": {"type": "string"},
   "year_from": {"type": "integer"},
   "max_results": {"type": "integer"}
  },
  "required": ["query"]
 }
}

Étape 3 — Fonction d’exécution

import requests

def search_openalex(query, year_from=2015, max_results=10):
 url = "https://api.openalex.org/works"
 params = {
  "search": query,
  "filter": f"publication_year:>{year_from}",
  "per-page": max_results,
  "sort": "cited_by_count:desc"
 }
 resp = requests.get(url, params=params,
  headers={"User-Agent": "these/1.0"})
 return resp.json().get("results", [])

Étape 4 — Boucle agent

import anthropic, json
client = anthropic.Anthropic()

def run_agent(question):
 messages = [{"role": "user",
  "content": f"Question : {question}"}]
 while True:
  resp = client.messages.create(
   model="claude-sonnet-4-20250514",
   max_tokens=4096,
   tools=[tool_search],
   messages=messages
  )
  if resp.stop_reason == "end_turn":
   return next(b.text for b in resp.content
    if hasattr(b, "text"))
  messages.append(
   {"role": "assistant", "content": resp.content})
  results = []
  for b in resp.content:
   if b.type == "tool_use":
    r = search_openalex(**b.input)
    results.append({"type": "tool_result",
     "tool_use_id": b.id,
     "content": json.dumps(r)})
  messages.append(
   {"role": "user", "content": results})

Étape 5 — Tester et affiner

Lisez le raisonnement avant les résultats. Ajustez le prompt si les mots-clés sont trop génériques.

Chunking en prompt engineering


6. Limites critiques

1. Hallucination bibliographique. Règle : jamais de référence sans avoir ouvert le PDF source. → Le RAG comme réponse architecturale

2. Biais de sélection transféré. Bonne sensibilité mais spécificité parfois faible. À documenter dans la section méthode.

3. Interprétation qualitative irremplaçable. La théorie institutionnelle (DiMaggio & Powell, 1983) ou le sensemaking (Weick, 1995) demandent une expertise disciplinaire que l’agent ne possède pas.

Scherbakov et al. (2025) : seule la moitié des études trouvent les LLMs prometteurs.


7. Questions fréquentes

Faut-il savoir coder ?
Non. Research sur claude.ai (plan Pro) fonctionne sans code.

Les références sont-elles fiables ?
OpenAlex retourne des DOIs vérifiables. Règle : ouvrir chaque PDF avant de citer.

Mon directeur peut-il contester ?
Oui si non déclaré. Documentez dans la section méthode.

Quel coût ?
10 à 40 €/mois avec Claude Sonnet pour un usage doctoral courant.

Codage d’entretiens ?
Oui en premier passage : accord inter-codeur 70–85 % sur grilles prédéfinies.


8. Ressources pédagogiques

Prompt — séminaire méthodologique

Tu es un assistant en sciences de gestion.
Question : [INSERER]
Cadre : [positiviste/interpretativiste/constructiviste]

ETAPE 1 - Cartographie theorique
5 courants : auteur, article, annee, mots-cles.

ETAPE 2 - Operateurs de recherche
3 requetes EN (booleens) + 2 requetes FR (CAIRN).

ETAPE 3 - Grille PRISMA
5 criteres inclusion/exclusion.

Pourquoi prompter par morceaux

Question socratique pour séminaire doctoral

« Si un agent IA avait conduit votre revue, comment sauriez-vous qu’il n’a pas reproduit les biais dominants plutôt que de les avoir identifiés ? »

Benchmark — veille bibliographique

Claude Research

Sources : Web + Drive
Export : Rapport + citations
Coût : Pro (20$/mois)
Idéal pour : Veille large

Elicit.org

Sources : Semantic Scholar
Export : CSV, RIS, BibTeX
Coût : Freemium
Idéal pour : PRISMA

Consensus.app

Sources : Semantic Scholar
Export : CSV
Coût : Freemium
Idéal pour : Questions empiriques

Autres cas d’usage en recherche académique

Corpus textuel

PDF, extraction concepts, bibliographie thématique.

PDF readerNLPCSV

Veille concurrentielle

Surveiller sites de marques, discours marketing, netnographie.

Web fetchDiffScheduler

Coding qualitatif

Verbatims d’entretiens, codage thématique, patterns.

File readerThematicXLSX

Revue PRISMA

Multi-bases, déduplication, screening, extraction.

OpenAlexSSRNDedup

Données secondaires

Eurostat, INSEE, analyses descriptives, graphiques.

PandasMatplotlib

Rédaction

Notes de terrain, reformulation selon normes revue.

File r/wDOCX
Conseil : commencez par un seul outil, une tâche de 3 minutes. La complexité vient naturellement.

9. Pistes de recherche ouvertes

  1. Reproductibilité : les résultats de screening sont-ils reproductibles entre sessions ?
  2. Cognitive offloading : que perd un doctorant qui délègue le premier tri ? (Risko & Gilbert, 2016)
  3. Biais disciplinaires : quelle représentation des traditions francophones (EGOS, AIMS) ?
  4. Gouvernance académique : quels cadres pour l’usage des agents en thèse ? Voir marché de l’édition scientifique.

Ressources pour aller plus loin


10. Références

Boiko et al. (2023). Emergent autonomous research capabilities of LLMs. arXiv:2304.05332. ✅

Brown et al. (2020). Language models are few-shot learners. NeurIPS 33. ✅

Martin, Cemaj & Cohen (2025). Scaling managed agents. Anthropic Engineering Blog. ✅

Anthropic (2025). How we built our multi-agent research system. ✅

Mukherjee & Chang (2025). Agentic AI. arXiv:2502.00289. ⚠️ préprint

Russell & Norvig (2021). AI: A Modern Approach, 4e éd. Pearson. ✅

Scherbakov et al. (2025). LLMs as tools in literature reviews. JAMIA 32(6). ✅

Wang et al. (2024). Survey on LLM-based autonomous agents. Frontiers of CS 18(6). ✅

Yao et al. (2022). ReAct. arXiv:2210.03629. ✅


Rédigé avec l’assistance de Claude (Anthropic). Références vérifiées avant publication.

Suivre le blog

Sans newsletter qui monétise vos données.

📡 RSS 📖 WP LinkedIn → S’abonner

En savoir plus sur Maria Mercanti-Guérin

Abonnez-vous pour poursuivre la lecture et avoir accès à l’ensemble des archives.

Poursuivre la lecture