
2024Données & Automatisation
Scraper de Données Twitter / X
Outil CLI Python basé sur Selenium pour extraire des tweets par profil, hashtag ou requête, avec authentification flexible et export CSV.
Le Défi
- Gérer de manière fiable le contenu Twitter dynamique rendu en JavaScript via Selenium
- Concevoir un système d'authentification flexible (variables d'environnement, args CLI, prompt interactif)
- Implémenter une extraction compatible avec les limites de fréquence sans bannissement
La Solution
- Utilisation de Selenium WebDriver avec attentes explicites pour stabiliser le rendu dynamique.
- Mise en place d'une authentification en cascade: arguments CLI, puis .env, puis prompt interactif.
- Ajout de limites configurables et d'un mode sans limite pour les collectes volumineuses.
Fonctionnalités Clés
- Extraction de tweets par profil, hashtag ou requête
- Authentification flexible: arguments CLI, fichier .env ou prompt interactif
- Limite de tweets configurable (50 par défaut ou illimitée)
- Support des tris latest et top
- Support des requêtes avancées compatibles recherche Twitter
- Export CSV avec métadonnées optionnelles du compte auteur
Processus
Phase 01
Configuration de Selenium avec ChromeDriver pour l'automatisation navigateur
Phase 02
Conception de l'interface CLI avec argparse et options d'authentification/extraction
Phase 03
Implémentation des modes d'extraction par profil, hashtag et requête
Phase 04
Ajout de l'export CSV avec champs étendus optionnels (followers/following)