
:rewind: acceuil
:fire: Worker très dépendant de l'API twitter
Ces données textuelles font l'objet d'un index à part: "textes_tweets" qui répond aux mêmes spécifications quie textes_parlement.
Pourquoi cela ?
--> Nous ne maitrisons pas le volume de tweets que peuvent générer 577 députés.
--> Cela permettrait d'avoir un cycle de vie de l'index différent (par exemple si l'on considère de ne pas conserver les tweets au dela d'un an/un mois/deux semaines)
Source de données:
API twitter statuses/filter: https://developer.twitter.com/en/docs/api-reference-index
Fréquence des mises à jour:
Le worker est associé au flux de tweets grâce à l'api de streaming de twitter.
C'est équivalent à recevoir un fichier json sans fin.
INDEX:
type:
Identifiant de monitoring du flux
TWEETS
Version
1
Utilisation de l'api streaming de twitter. Pas de récupération des RETWEETS (choix à discuter) Pas de récupération de l'historique de tweets des députés (limitations sur API standard) A SAVOIR: en cas dépassement de la pile ou de déconnexion intempestive, un délai de reconnection suffisant a été instauré pour éviter le blockage par Twitter. C'est le seul risque de perte de données.
env.list ou variables d'envionement contenant:
CONSUMER_KEY=
CONSUMER_SECRET=
ACCESS_TOKEN=
ACCESS_SECRET=
ELASTIC_ID=
ELASTIC_PSSWD=
nohup sudo docker run --env-file ./env.list stackateam/flux_tweets:latest > flux.txt &
Sur une instance EC2 AWS linux, t2.micro
Content type
Image
Digest
Size
1.5 GB
Last updated
about 6 years ago
docker pull stackateam/flux_tweets