R6.01 - Big Data : enjeux, stockage et extraction
BUT Science des Données
Moodle : https://moodlelms.univ-paris13.fr/course/view.php?id=7317
Syllabus
- Introduction au traitement du texte et à la recherche d’information
- Le modèle vectoriel, tf.idf
- Indexation de pages web : PageRank
- Sémantique latente (LSA, LSI)
- Calcul distribué : MapReduce, Hadoop, Spark
SAÉ 6.01 : modélisation statistique pour données complexes
Défi 6.01 : https://www.kaggle.com/t/6f2e4515a47147f4bae4a54b21ead689