Scraper de Données Twitter / X
2024Données & Automatisation

Scraper de Données Twitter / X

Outil CLI Python basé sur Selenium pour extraire des tweets par profil, hashtag ou requête, avec authentification flexible et export CSV.

Le Défi

  • Gérer de manière fiable le contenu Twitter dynamique rendu en JavaScript via Selenium
  • Concevoir un système d'authentification flexible (variables d'environnement, args CLI, prompt interactif)
  • Implémenter une extraction compatible avec les limites de fréquence sans bannissement

La Solution

  • Utilisation de Selenium WebDriver avec attentes explicites pour stabiliser le rendu dynamique.
  • Mise en place d'une authentification en cascade: arguments CLI, puis .env, puis prompt interactif.
  • Ajout de limites configurables et d'un mode sans limite pour les collectes volumineuses.

Fonctionnalités Clés

  • Extraction de tweets par profil, hashtag ou requête
  • Authentification flexible: arguments CLI, fichier .env ou prompt interactif
  • Limite de tweets configurable (50 par défaut ou illimitée)
  • Support des tris latest et top
  • Support des requêtes avancées compatibles recherche Twitter
  • Export CSV avec métadonnées optionnelles du compte auteur

Processus

Phase 01

Configuration de Selenium avec ChromeDriver pour l'automatisation navigateur

Phase 02

Conception de l'interface CLI avec argparse et options d'authentification/extraction

Phase 03

Implémentation des modes d'extraction par profil, hashtag et requête

Phase 04

Ajout de l'export CSV avec champs étendus optionnels (followers/following)