Data Scientist

de bac+2 à bac+3 · ROME M1405

Aussi appelé : Scientifique des données · Data Analyst avancé · Machine Learning Engineer · Chercheur en données · Ingénieur en science des données · AI Scientist · Analyste prédictif

Spécialités

traitement du langage naturelcomputer visionséries temporellesrecommandation et rankingdétection d'anomaliesoptimisation et recherche opérationnelle

Ce métier permet de

R+T est premier car le critère de réussite est « j'ai compris » : le Data Scientist part d'une question métier floue, explore les données pour clarifier le problème, puis seulement après descend vers la production de modèles qui fonctionnent.

Où l’exerce-t-on

Data Scientist R&D / Deep Tech · 15 %Profil très technique orienté recherche, développant des modèles de machine learning et deep…

Profil très technique orienté recherche, développant des modèles de machine learning et deep learning avancés, publiant dans des conférences académiques, travaillant sur des problématiques de pointe (NLP, vision par ordinateur, IA générative). Forte composante de réflexion abstraite et d'innovation algorithmique.

Secteurs — Technologies de l'information, Recherche et développement, Défense et aérospatiale, Santé et biotechnologies, Robotique

Employeurs — GAFAM (Google, Meta, Apple), Laboratoires de recherche (INRIA, CNRS), Startups deep tech IA, Centres R&D grands groupes (Thales, Airbus, Safran), Criteo, Hugging Face, Mistral AI

Pour commencer — Research Scientist Junior, Data Scientist R&D, Machine Learning Research Engineer, Doctorant CIFRE en IA

Ensuite — Staff Research Scientist, Principal Scientist, Head of AI Research, Directeur scientifique IA, CTO startup IA

Data Scientist Entreprise / Business Intelligence avancée · 40 %Profil alliant compétences techniques en modélisation statistique et machine learning avec une…

Profil alliant compétences techniques en modélisation statistique et machine learning avec une forte compréhension des enjeux métier. Travaille en étroite collaboration avec les équipes business pour transformer les données en décisions stratégiques. Polyvalence technique-communication valorisée.

Secteurs — Banque et assurance, Grande distribution et e-commerce, Énergie, Conseil et services numériques, Télécommunications, Industrie

Employeurs — Grands groupes (BNP Paribas, Société Générale, AXA, Total Energies), ETI innovantes, Cabinets de conseil data (Quantmetry, Artefact, Ekimetrics), ESN spécialisées data (Dataiku, Capgemini Insights & Data), E-commerce (Cdiscount, Veepee, ManoMano)

Pour commencer — Data Scientist Junior, Consultant Data Science, Analyste quantitatif junior, Chargé d'études data

Ensuite — Lead Data Scientist, Head of Data Science, Chief Data Officer, Directeur Analytics, Partner Data dans un cabinet de conseil

Data Scientist Statistiques / Actuariat / Quantitatif · 15 %Profil fortement ancré en mathématiques et statistiques, spécialisé dans la modélisation…

Profil fortement ancré en mathématiques et statistiques, spécialisé dans la modélisation probabiliste, l'actuariat, la finance quantitative ou l'économétrie. Rigueur méthodologique très élevée, travail souvent réglementé (Solvabilité II, Bâle III).

Secteurs — Assurance, Banque d'investissement, Finance quantitative, Organismes publics et statistiques, Réassurance

Employeurs — Compagnies d'assurance (AXA, Allianz, Generali), Banques d'investissement (Natixis, BNP CIB, Société Générale CIB), Fonds d'investissement quantitatifs, INSEE et organismes statistiques publics, Autorités de régulation (ACPR, AMF)

Pour commencer — Data Scientist actuariat, Analyste quantitatif junior, Statisticien modélisateur, Chargé d'études statistiques

Ensuite — Actuaire data scientist senior, Head of Quantitative Analytics, Directeur de la modélisation des risques, Chief Risk Officer adjoint

ML Engineer / Data Scientist orienté production · 20 %Profil hybride entre data science et ingénierie logicielle, centré sur la mise en production…

Profil hybride entre data science et ingénierie logicielle, centré sur la mise en production de modèles ML (MLOps), le déploiement à grande échelle, l'optimisation des performances et la fiabilisation des pipelines de données. Forte composante technique et méthodique.

Secteurs — Technologies de l'information et logiciels, Industrie automobile et manufacturière, Santé numérique (HealthTech), Plateformes numériques, IoT et systèmes embarqués

Employeurs — Scale-ups tech (Datadog, Contentsquare, Mirakl), Plateformes numériques (Deezer, Dailymotion, Doctolib), GAFAM et big tech, Éditeurs de logiciels IA (Dataiku, Hugging Face), Grands groupes industriels (Renault, Stellantis, Schneider Electric)

Pour commencer — Machine Learning Engineer Junior, Data Scientist MLOps, Ingénieur IA junior, Développeur Machine Learning

Ensuite — Senior ML Engineer, Staff Machine Learning Engineer, Head of ML Engineering, VP Engineering AI, Architecte IA

Data Scientist Secteur Public / Santé / Impact · 10 %Profil engagé utilisant la data science au service de l'intérêt général : santé publique,…

Profil engagé utilisant la data science au service de l'intérêt général : santé publique, politiques publiques, environnement, ONG. Sensibilité éthique et capacité à communiquer avec des non-techniciens. Environnements souvent plus contraints en moyens mais riches de sens.

Secteurs — Secteur public et administrations, Santé et recherche médicale, Environnement et développement durable, Organisations internationales, Économie sociale et solidaire

Employeurs — Ministères et administrations (Etalab, DINUM, DREES), Hôpitaux et instituts de recherche médicale (AP-HP, INSERM, Institut Curie), Organisations internationales (OMS, Banque Mondiale), ONG data (Data for Good, Bayes Impact), Collectivités territoriales

Pour commencer — Data Scientist santé publique, Chargé de mission data administration, Data Scientist environnement, Biostatisticien data scientist

Ensuite — Lead Data Scientist secteur public, Directeur de la donnée hospitalière, Chief Data Officer ministériel, Responsable IA éthique

Le métier au quotidien

RythmeAlternance entre phases d'exploration calme (recherche de modèles, prototypage) et sprints…

Alternance entre phases d'exploration calme (recherche de modèles, prototypage) et sprints intenses lors de mise en production ou restitution de résultats. Deadlines souvent liées aux cycles business (trimestres, campagnes) plutôt qu'à l'urgence pure, mais la pression monte quand les résultats tardent ou déçoivent.

AutonomieForte autonomie technique sur le choix des approches et algorithmes, mais cadrage métier…

Forte autonomie technique sur le choix des approches et algorithmes, mais cadrage métier souvent imposé par les équipes Product ou métier. Tu définis comment, rarement le quoi. Les juniors passent beaucoup de temps à nettoyer des données, les seniors arbitrent les priorités et orientent la stratégie data.

InteractionsCollaboration quotidienne avec data engineers (infrastructure), product managers (besoins…

Collaboration quotidienne avec data engineers (infrastructure), product managers (besoins métier), et stakeholders non techniques à qui tu dois vulgariser tes trouvailles. Les échanges avec d'autres data scientists restent rares hors grandes structures, ce qui peut isoler intellectuellement.

Environnement physiqueÉcran, souvent double ou triple, dans des open spaces tech ou en full remote.

Écran, souvent double ou triple, dans des open spaces tech ou en full remote. Peu de déplacements sauf pour conférences ou formations. L'ergonomie compte : tu passes 70 à 90% de ton temps assis à coder, tester, visualiser.

MobilitéGéographiquement flexible grâce au remote généralisé dans la tech, mais concentration des…

Géographiquement flexible grâce au remote généralisé dans la tech, mais concentration des postes seniors dans les métropoles et hubs tech. Mobilité sectorielle large (santé, finance, retail, industrie) une fois l'expertise acquise, moins facile en début de carrière où les profils généralistes peinent face aux spécialistes.

Charge et pressionModéré mais insidieux : frustration quand les données sont sales ou incomplètes (c'est la…

Modéré mais insidieux : frustration quand les données sont sales ou incomplètes (c'est la norme), quand les modèles ne convergent pas, ou quand tes recommandations ne sont pas suivies. Pression pour livrer vite des « insights actionnables » alors que la science demande du temps. Le syndrome de l'imposteur frappe fort dans un domaine qui évolue trop vite pour tout maîtriser.

Évolution de carrièreTrajectoires multiples : spécialisation technique (MLOps, NLP, Computer Vision), virage vers…

Trajectoires multiples : spécialisation technique (MLOps, NLP, Computer Vision), virage vers l'ingénierie (ML Engineer), management d'équipe data, ou pivot produit/strategy. Plafond de verre dans les petites structures où tu restes seul data scientist couteau suisse. Les profils senior basculent souvent en Lead, Head of Data, ou partent en freelance pour diversifier.

Compétences

Techniques · 15Machine Learning (supervisé et non supervisé) : régressions, arbres, SVM, clustering, réduction de dimension, Deep Learning : réseaux de neurones (CNN, RNN, Transformers, GANs), Statistiques inférentielles et probabilités avancées…
Machine Learning (supervisé et non supervisé) : régressions, arbres, SVM, clustering, réduction de dimensionDeep Learning : réseaux de neurones (CNN, RNN, Transformers, GANs)Statistiques inférentielles et probabilités avancéesProgrammation Python avancée (NumPy, Pandas, Scikit-learn, PyTorch, TensorFlow)Programmation R pour l'analyse statistiqueSQL avancé et manipulation de bases de données relationnelles et NoSQLTraitement du langage naturel (NLP) et Large Language ModelsVision par ordinateur (Computer Vision)Feature engineering et préparation des donnéesSéries temporelles et modélisation prédictiveOptimisation mathématique et recherche opérationnelleExpérimentation et tests A/BMLOps : déploiement et monitoring de modèles en productionBig Data : Spark, Hadoop, traitement distribuéCloud computing (AWS SageMaker, GCP Vertex AI, Azure ML)
Transversales · 12Pensée analytique et raisonnement logique, Capacité d'abstraction mathématique, Communication des résultats à des publics non techniques (data storytelling)…
Pensée analytique et raisonnement logiqueCapacité d'abstraction mathématiqueCommunication des résultats à des publics non techniques (data storytelling)Curiosité intellectuelle et veille scientifique permanenteRigueur méthodologique et esprit critique face aux donnéesTravail en équipe pluridisciplinaire (métier, ingénierie, product)Gestion de projet et priorisationÉthique des données et de l'IA (biais, équité, RGPD)Capacité à formuler un problème métier en problème mathématiqueAutonomie et auto-formation continueRestitution visuelle et data visualizationAnglais technique courant (lecture d'articles, documentation, conférences)
Numériques · 14Python (écosystème data science complet), R et RStudio, SQL et bases de données (PostgreSQL, BigQuery, MongoDB)…
Python (écosystème data science complet)R et RStudioSQL et bases de données (PostgreSQL, BigQuery, MongoDB)Jupyter Notebook / JupyterLabGit et versionnement de codeDocker et conteneurisationPlateformes cloud (AWS, GCP, Azure)Outils de visualisation (Matplotlib, Seaborn, Plotly, Tableau, Power BI)Frameworks ML/DL (Scikit-learn, PyTorch, TensorFlow, Keras, XGBoost, LightGBM)Outils MLOps (MLflow, Kubeflow, Airflow, DVC)Spark / PySpark pour le traitement distribuéAPI REST et intégration de modèlesEnvironnements Linux/UnixOutils collaboratifs (Notion, Confluence, Slack)

Ce que ce métier permet de développer

Se développer ●●●●●Apprentissage permanent quasi obligatoire : nouvelles librairies, papiers de recherche,…

Apprentissage permanent quasi obligatoire : nouvelles librairies, papiers de recherche, frameworks qui se renouvellent tous les 18 mois. Idéal pour les profils qui jouissent de la complexité intellectuelle, épuisant pour ceux qui cherchent la stabilité technique. Conférences, MOOCs, Kaggle, GitHub : la communauté est prolifique mais tu dois trier et rester humble face à l'ampleur du champ.

Prendre des initiatives ●●●○○Tu proposes, rarement tu imposes.

Tu proposes, rarement tu imposes. L'autonomie technique est réelle (tester tel algo, optimiser tel pipeline), mais les sujets et priorités viennent souvent d'en haut. Dans les scale-ups ou grands groupes matures data, tu peux piloter des POC stratégiques ; dans les PME, tu es souvent en mode pompier réactif face aux demandes métier. Les freelances et seniors en poste de Lead récupèrent plus de latitude.

Agir sur le monde ●●●●○Impact variable selon le secteur : fort dans la santé (diagnostic, recherche clinique),…

Impact variable selon le secteur : fort dans la santé (diagnostic, recherche clinique), l'écologie (modélisation climat, biodiversité), ou l'éducation ; plus discutable dans l'ad-tech ou la finance spéculative. Tu peux transformer des décisions à grande échelle, mais aussi te retrouver à optimiser des taux de clic sur des bannières. La satisfaction dépend autant du projet que de ton alignement éthique.

Stabilité économique ●●●●○Marché porteur depuis 10 ans avec des salaires au-dessus de la médiane tech dès l'entrée…

Marché porteur depuis 10 ans avec des salaires au-dessus de la médiane tech dès l'entrée (40 k€), montée rapide possible (75 k€+ en senior, 100 k€+ en Lead dans les GAFAM/licornes). Mais : bulles d'embauche qui se dégonflent (2023-2024), concurrence accrue des profils juniors sur-diplômés, et automatisation croissante des tâches basiques par l'IA elle-même. La vraie sécurité vient de la spécialisation (NLP médical, séries temporelles financières) plus que du titre générique.

Marché de l’emploi

40 → 75 k€ par an

Tension au recrutementMarché paradoxal : pénurie de profils seniors expérimentés capables de cadrer des projets de…

Marché paradoxal : pénurie de profils seniors expérimentés capables de cadrer des projets de bout en bout, mais saturation relative de juniors M2/doctorants qui peinent à décrocher un premier poste faute d'expérience terrain et de compétences en déploiement, surtout hors Île-de-France et grandes métropoles.

Tendance du secteurProfessionnalisation accélérée avec montée en puissance des MLOps et DataOps qui poussent vers…

Professionnalisation accélérée avec montée en puissance des MLOps et DataOps qui poussent vers l'industrialisation, pendant que l'IA générative redistribue les cartes en automatisant certaines tâches exploratoires et en valorisant les profils hybrides produit/data capables de concevoir des use cases pertinents plutôt que juste des modèles.

Paris et Île-de-France (65% des offres)Lyon et métropole lyonnaiseToulouse (aérospatial et IA)Grenoble (deep tech et recherche)Nantes et Rennes (écosystème numérique breton)BordeauxSophia Antipolis (data et télécoms)LilleTélétravail partiel ou complet (croissant)

Parcours de formation

FormationDuréeNiveauParcoursup
Master en Data Science / Intelligence Artificielle (université)5 ansbac+5oui
Diplôme d'ingénieur spécialisation Data Science / IA5 ansbac+5oui
Master Statistiques et modélisation / Mathématiques appliquées5 ansbac+5oui
Doctorat en Machine Learning / Statistiques / IA8 ansbac+8
Mastère spécialisé / MSc Data Science (formation continue ou reconversion bac+5)1 anbac+6
Bachelor / Licence Informatique puis Master spécialisé (parcours progressif)5 ansbac+5oui