Finder
Transformer les archives du web en mémoire d’entreprise
Un moteur de données à grande échelle qui traite les archives du web, reconnecte les identités fragmentées et produit des profils professionnels vérifiables.

L’opportunité
Une intelligence cachée dans le temps
Des milliards de pages archivées conservent des traces de relations commerciales, d’équipes, de rôles et d’entreprises qui ont disparu du web actuel. Ces données peuvent aider à comprendre l’évolution d’un marché ou à retrouver un contact, mais leur volume et leur hétérogénéité rendent les méthodes conventionnelles peu réalistes.
Finder devait transformer cette histoire dormante en une base vivante. La difficulté était double : isoler la faible proportion d’informations réellement utile sans télécharger des téraoctets inutilement, puis reconnecter des identités dispersées au fil des années et des changements de sites.
La solution
Traiter le signal, pas le bruit
Nous avons développé une architecture qui lit les jeux de données de l’Internet Archive directement sous forme compressée et par segments contrôlés. Les contenus sans valeur sont écartés tôt dans la chaîne ; seuls les enregistrements utiles poursuivent le traitement. Cette approche diminue la bande passante, le stockage temporaire, le calcul et donc le coût d’infrastructure.
Des outils spécialisés extraient ensuite les e-mails, numéros de téléphone, noms, domaines, rôles et entreprises. Les doublons et fragments sont fusionnés afin de construire des profils cohérents à partir de traces qui, prises individuellement, seraient incomplètes.
L’ingénierie
Une résolution d’entités à l’échelle des archives
Le pipeline combine traitement de flux compressés, lots reprenables, extraction sélective et travailleurs asynchrones. Une interruption ne force pas à recommencer un fichier entier : le système reprend le travail au bon point et évite les calculs déjà effectués.
La couche de résolution d’entités rapproche les noms, domaines, fonctions, e-mails et téléphones à travers le temps. Plusieurs signaux servent à vérifier la fraîcheur, la joignabilité et la fiabilité de chaque profil. Le résultat n’est pas seulement une donnée trouvée, mais une donnée expliquée par ses sources et accompagnée d’un niveau de confiance.
Le résultat
Des années de web rendues interrogeables
Finder convertit des archives massives et dispersées en une base d’intelligence structurée. Les utilisateurs peuvent retrouver des personnes, des entreprises et des relations historiques qui resteraient invisibles dans les bases actuelles.
Le projet montre qu’à grande échelle, l’efficacité vient autant de ce que l’on décide de ne pas traiter que de la puissance de calcul disponible. En filtrant tôt et en vérifiant tard, la plateforme crée une mémoire d’entreprise utile, traçable et économiquement exploitable.


