Poste rattaché au Service Data Factory & Analytics (Direction Développement et Innovation).
L'objectif principal est de développer une solution permettant d'automatiser le processus d'extraction d'informations pertinentes à partir de documents médicaux non structurés et d’évaluer les performances de cette solution.
Tâches principales :
- Compréhension des données médicales : familiarisation avec les différents types de comptes rendus médicaux. Analyse des spécificités linguistiques et des structures de ces documents.
- Développement d'un pipeline d'extraction : conception et mise en œuvre d'un pipeline automatisé utilisant Mistral AI pour extraire les variables d’intérêts à partir des documents médicaux, et permettant d’alimenter une base de données structurée.
- Évaluation de la performance de la solution en termes de précision, de rappel et de F1-score en utilisant une base de données manuellement saisie comme Gold Standard.
- Identification des opportunités d'amélioration et itération du modèle pour une extraction plus performante.
- Adaptation du process pour extraire différentes variables.
Cette alternance offre une opportunité unique d'acquérir des compétences pratiques en data science appliquée à la santé, tout en contribuant au développement d'une solution innovante essentielle pour exploiter des données médicales non structurées. L’alternant travaillera en étroite collaboration avec une équipe multidisciplinaire composée de spécialistes en biostatistique et en oncologie.