La Data Science est un vaste champ d'étude interdisciplinaire dont le but fondamental est d'extraire de la connaissance à partir des données. On y emploie principalement des techniques et des théories issues des mathématiques appliquées et de l'informatique. La Data Science étend ces techniques au contexte de l'entreprise par la création…
Cet article retrace les origines de l'apprentissage automatique (machine learning), discipline clé de la data science. Arthur Samuel, en 1956, a posé les fondements en programmant l'ordinateur IBM 701 pour apprendre à jouer aux dames en jouant contre lui-même, sans instructions explicites. En 1962, le programme battait le champion du Connecticut — une première historique montrant qu'une machine pouvait challenger l'intellect humain.
L'auteur souligne un changement de paradigme majeur : l'apprentissage automatique abandonne la méthode scientifique traditionnelle (observation, hypothèse, test, généralisation) pour se concentrer sur l'identification de corrélations dans les données, plutôt que la compréhension des liens de causalité. L'exemple de Google illustre bien cette approche : plutôt que de modéliser pourquoi un utilisateur clique sur un lien, on analyse massivement les comportements de navigation pour prédire quelle page proposer.
Cet changement offre un avantage : des modèles plus souples et adaptatifs aux données réelles, sans être figés par des équations prédéfinies. Mais il implique une perte : l'incapacité à expliquer complètement les décisions produites par le système.