ICOpedia

La recherche sémantique transforme notre façon de trouver les données de développement

page-banner-circle
blog-page-banner
Un réseau abstrait de points connectés, représentant la recherche sémantique de données de développement

Faites l’expérience. Rendez-vous sur n’importe quel grand portail de données de développement (IATI Datastore, la base de données de projets de la Banque mondiale, une bibliothèque documentaire d’une agence des Nations Unies) et recherchez « programmes de résilience communautaire au Sahel ».

Recherche sémantique des données de développement

Vous obtiendrez des résultats. Certains seront pertinents. Beaucoup ne le seront pas. Et vous passerez presque certainement à côté de documents qui utilisent une terminologie différente pour le même concept : « renforcement de la résilience communautaire », « adaptation à base communautaire », « gestion du risque pastoral » ou « protection sociale en contextes fragiles ».

Le même concept. Des mots différents. La recherche traditionnelle par mots-clés les traite comme des requêtes totalement sans rapport.

Comment la recherche par mots-clés échoue dans le secteur du développement

La plupart des bases de données de développement reposent encore sur la correspondance par mots-clés, la même technologie qui alimentait les moteurs de recherche au début des années 2000. Tapez un mot, obtenez les documents contenant ce mot exact (ou une variante proche). Cela fonctionne bien quand vous savez exactement ce que vous cherchez et que vous connaissez son appellation.

Dans le développement international, ces deux conditions échouent régulièrement.

Premièrement, le problème multilingue. Les documents de développement existent en anglais, français, espagnol, arabe, portugais et des dizaines d’autres langues. Une recherche par mots-clés en anglais ne trouvera pas les documents en français, même quand ils décrivent des programmes identiques. Pour les consultants qui travaillent au Sahel, où le français et l’anglais coexistent comme langues de travail, cela veut dire que la moitié de la base de connaissances pertinente reste invisible.

Deuxièmement, le problème du vocabulaire. Le développement a un problème de jargon. Chaque donateur, agence et cadre d’évaluation utilise une terminologie légèrement différente. Ce que la Banque mondiale appelle « filets de protection sociale », l’UE l’appelle « socles de protection sociale », et un document du gouvernement sénégalais l’appelle « filets sociaux ». C’est la même chose. La recherche par mots-clés ne le sait pas.

Troisièmement, le problème conceptuel. Parfois, vous ne cherchez pas un terme précis du tout. Vous voulez trouver des projets qui ont abordé un type particulier de défi, ou des évaluations qui ont mesuré un type particulier de résultat. Vous cherchez du sens, pas des mots.

Ce que fait réellement la recherche sémantique

La recherche sémantique fonctionne autrement. Au lieu de faire correspondre des chaînes de caractères, elle convertit le texte en représentations mathématiques (les « embeddings ») qui capturent le sens. Deux phrases qui veulent dire la même chose avec des mots complètement différents auront des embeddings proches. Deux phrases qui partagent des mots mais veulent dire des choses différentes auront des embeddings différents.

En pratique, cela veut dire que vous pouvez chercher dans une base de données de documents de développement en anglais et trouver des résultats pertinents en français. Vous pouvez chercher « réponse à la sécheresse » et trouver des documents sur « les systèmes d’alerte précoce pour l’insécurité alimentaire », parce que le système comprend que ce sont des concepts liés.

La technologie derrière tout cela a mûri vite. Des modèles comme les embeddings multilingues de Voyage AI peuvent représenter du texte dans plus de 100 langues dans le même espace mathématique. Combinés avec des bases de données vectorielles (comme pgvector, qui tourne sur PostgreSQL), cela donne des systèmes de recherche à la fois performants et pratiques à déployer.

RAG : quand la recherche rencontre l’intelligence

La recherche sémantique va encore plus loin quand on la combine avec la Génération Augmentée par Récupération, ou RAG. Dans un système RAG, la question d’un utilisateur déclenche d’abord une recherche sémantique pour trouver les documents les plus pertinents. Ces documents sont ensuite transmis à un modèle de langage, qui rédige une réponse ancrée dans le matériel source réel.

Au lieu d’obtenir une liste de 200 documents à parcourir, vous obtenez une réponse directe, avec des citations qui pointent vers les sources originales que vous pouvez vérifier.

Pour un consultant en développement qui prépare une proposition de projet, cela change radicalement la phase de recherche. Au lieu de passer deux jours à lire des documents de projets de la Banque mondiale, vous pouvez demander : « Quelles ont été les principales leçons tirées des projets de gestion communautaire des ressources naturelles en Mauritanie entre 2018 et 2024 ? » et obtenir une réponse synthétisée en quelques secondes, avec des liens vers les évaluations sources.

Comment ICOpedia utilise cette technologie

La couche d’intelligence documentaire d’ICOpedia est construite exactement sur cette architecture : embeddings multilingues (Voyage AI), stockage vectoriel (pgvector sur Supabase) et synthèse par RAG (Claude API). Le système ingère des documents provenant de l’IATI, des portails de donateurs et des rapports institutionnels téléchargés, les convertit en embeddings recherchables et les rend interrogeables via une interface en langage naturel.

Le résultat : un professionnel du développement à Nouakchott peut chercher en français et trouver des évaluations de la Banque mondiale en anglais. Un consultant à Dakar peut poser une question conceptuelle et obtenir des réponses tirées de l’ensemble du corpus documentaire, pas seulement des documents qui utilisaient les bons mots-clés.

L’écart est large : il sépare l’accès à une fraction des connaissances accumulées du secteur de l’accès à leur totalité.

Ce qui vient ensuite

La recherche sémantique dans le développement en est encore à ses débuts. La plupart des grandes plateformes ne l’ont pas encore adoptée. Les organisations et les outils qui franchiront le pas en premier auront une vraie avance, pas seulement en qualité de recherche, mais dans la profondeur des analyses qu’ils peuvent tirer des données existantes.

Les connaissances existent déjà. La technologie pour les exploiter est là. La seule question est la rapidité avec laquelle le secteur s’en emparera.