
(Documentation générale: https://bitbucket.org/stackadoc/index/src/master/README.md)
Toutes les entreprises de france, exceptées celles ayant fait l'objet d'une liquidation, ou étant en cours de clôture.
Pour les recherches orientées cessions/clotures/rachats etc CF Flux BODACC.
Source de données:
Base de Sirene de DATA.GOUV: https://www.data.gouv.fr/en/datasets/base-sirene-des-entreprises-et-de-leurs-etablissements-siren-siret/
Chiffres-clés récoltés par l'INSEE sur 2018 et 2019: https://opendata.datainfogreffe.fr/explore/dataset/chiffres-cles-2019/export/?sort=ca_1
Fiches d'identités recensées par le RNCS (API): https://entreprise.data.gouv.fr/api_doc_rncs
Fréquence des mises à jour:
MAJ systématique toutes les 12 heures
INDEX:
type:
La source de données 1 permet d'obtenir un liste de numéros de sirene très large, mais avec peu d'info. Dans cette liste, si le sirene est également référencé par l'une ou l'autre des sources de données 2 et 3, alors il fera l'objet d'un ajout.
Plus précisément:
Nous avons tous les sirenes dans 1 mais avec trop peu d'information pour les indexer. Alors, nous utilisons 2 et 3 pour enrichir les sirenes venant de 1.
La source 3 ne met pas à disposition la liste des sirenes interrogeables, c'est pourquoi nous utilisons 1 comme base sirene.
Le processus est donc le suivant:
je prends un SIRENE de 1:
si il est présent dans 2, j'accumule les infos de 1+2, puis push.
Si il n'est pas présent dans 2 alors je requête 3 avec SIRENE, et si j'ai une réponse de l'api, j'accumule les infos de 1+3, puis push. (c'est lors de cette étape que l'on est limités à 7 appels par secondes)
Sinon je n'indexe pas le SIREN en question.
env.list ou variables d'envionement contenant:
ELASTIC_ID=
ELASTIC_PSSWD=
nohup sudo docker run --env-file ./env.list stackateam/flux_entreprises:latest > flux.txt &
Sur une instance EC2 AWS linux, t2.medium
Content type
Image
Digest
Size
445.2 MB
Last updated
over 6 years ago
docker pull stackateam/flux_entreprises