Ferrum Group
Toutes les réalisations
Data & intelligence économique

Finder

Transformer les archives du web en mémoire d’entreprise

Un moteur de données à grande échelle qui traite les archives du web, reconnecte les identités fragmentées et produit des profils professionnels vérifiables.

2 min de lectureData engineeringEntity resolutionWeb archive
Couverture de l'étude de cas Finder

L’opportunité

Une intelligence cachée dans le temps

Des milliards de pages archivées conservent des traces de relations commerciales, d’équipes, de rôles et d’entreprises qui ont disparu du web actuel. Ces données peuvent aider à comprendre l’évolution d’un marché ou à retrouver un contact, mais leur volume et leur hétérogénéité rendent les méthodes conventionnelles peu réalistes.

Finder devait transformer cette histoire dormante en une base vivante. La difficulté était double : isoler la faible proportion d’informations réellement utile sans télécharger des téraoctets inutilement, puis reconnecter des identités dispersées au fil des années et des changements de sites.

La solution

Traiter le signal, pas le bruit

Nous avons développé une architecture qui lit les jeux de données de l’Internet Archive directement sous forme compressée et par segments contrôlés. Les contenus sans valeur sont écartés tôt dans la chaîne ; seuls les enregistrements utiles poursuivent le traitement. Cette approche diminue la bande passante, le stockage temporaire, le calcul et donc le coût d’infrastructure.

Des outils spécialisés extraient ensuite les e-mails, numéros de téléphone, noms, domaines, rôles et entreprises. Les doublons et fragments sont fusionnés afin de construire des profils cohérents à partir de traces qui, prises individuellement, seraient incomplètes.

L’ingénierie

Une résolution d’entités à l’échelle des archives

Le pipeline combine traitement de flux compressés, lots reprenables, extraction sélective et travailleurs asynchrones. Une interruption ne force pas à recommencer un fichier entier : le système reprend le travail au bon point et évite les calculs déjà effectués.

La couche de résolution d’entités rapproche les noms, domaines, fonctions, e-mails et téléphones à travers le temps. Plusieurs signaux servent à vérifier la fraîcheur, la joignabilité et la fiabilité de chaque profil. Le résultat n’est pas seulement une donnée trouvée, mais une donnée expliquée par ses sources et accompagnée d’un niveau de confiance.

Le résultat

Des années de web rendues interrogeables

Finder convertit des archives massives et dispersées en une base d’intelligence structurée. Les utilisateurs peuvent retrouver des personnes, des entreprises et des relations historiques qui resteraient invisibles dans les bases actuelles.

Le projet montre qu’à grande échelle, l’efficacité vient autant de ce que l’on décide de ne pas traiter que de la puissance de calcul disponible. En filtrant tôt et en vérifiant tard, la plateforme crée une mémoire d’entreprise utile, traçable et économiquement exploitable.

VOTRE PROJET

Construisons le système qui vous manque.

Nous partons de vos contraintes réelles pour concevoir une plateforme métier fiable, exploitable et faite pour durer.

Réserver une consultation gratuite