Data Scientist · Ricerca clinica · Bergamo
Rasoul Samei
Lavoro con dati clinici di terapia intensiva presso l’Istituto Mario Negri. Mi occupo soprattutto di integrare e strutturare database clinici complessi, trasformandoli in dati affidabili e utilizzabili per l’analisi e la ricerca.
Sono attualmente alla ricerca di un dottorato o di una posizione di ricerca nell’ambito dei dati sanitari.
Esplora i progetti Scarica il CV
Chi sono
Sono un data scientist specializzato nella ricerca clinica e, da novembre 2024, lavoro presso l’Istituto di Ricerche Farmacologiche Mario Negri di Ranica.
Il mio lavoro si concentra soprattutto sui dati di terapia intensiva: integro database clinici complessi, preparo dataset e tabelle analitiche per gli studi di ricerca e svolgo le relative analisi statistiche.
Tra i progetti che ho sviluppato c’è una dashboard analitica con un assistente basato su un modello linguistico, che permette ai ricercatori di interrogare i dati dei propri studi usando il linguaggio naturale.
In un altro progetto, realizzato per una tesi di specializzazione presso l’Università di Bologna, ho progettato uno strumento di estrazione dati che non richiede programmazione, permettendo al medico di eseguire direttamente le analisi sui dati di terapia intensiva senza competenze specifiche di data management e senza dipendere dal mio intervento.
Una parte importante del mio lavoro consiste anche nel capire fino a che punto i dati possano realmente sostenere una conclusione o un’ipotesi. È un aspetto che ho approfondito lavorando a stretto contatto con clinici e statistici.
Prima di entrare al Mario Negri, ho trascorso sei mesi nel Regno Unito presso The Openwork Partnership, dove mi sono occupato di anomaly detection applicata ai dati dei servizi di consulenza finanziaria in un contesto regolamentato.
In precedenza sono stato assistente alla didattica per il corso di Machine Learning presso l’Università degli Studi di Bergamo.
Sono iraniano e vivo a Bergamo.
- 3pubblicazioni peer-reviewed
- 900+ righedi SQL in una pipeline operativa su BigQuery
- 28+ KPIaziendali definiti e validati
- 1° postoallo Stat-Hackathon Bergamo 2022 con il mio team
Ricerca
I miei principali interessi di ricerca riguardano gli score di gravità, la calibrazione dei modelli e l’analisi di dati longitudinali.
Prima di qualsiasi analisi, però, c’è un passaggio fondamentale: rendere i dati clinici provenienti da più centri sufficientemente coerenti e comparabili da poter formulare domande di ricerca affidabili.
Una parte significativa del mio lavoro si concentra proprio su questo processo.
Finora ho lavorato con dati GiViTI e MIMIC.
-
2025
Development and Validation of the Sequential Organ Failure Assessment (SOFA)-2 Score
JAMA, 334(23): 2090–2103
Coautore dello studio. Mi sono occupato dell’estrazione e dell’elaborazione dei dati dal database clinico MargheritaTre (GiViTI), delle analisi statistiche e della revisione del manoscritto.
-
2025
Anomaly Detection in Financial Advisory Services: A Machine Learning Approach for Mortgage Conduct of Business Advisers
ICSEM 2025
Sviluppo di un approccio di anomaly detection non supervisionata applicato ai dati sulle performance dei consulenti ipotecari in un contesto regolamentato. Il sistema è stato sviluppato con Azure Machine Learning per supportare i processi di verifica della conformità ed è nato dal lavoro svolto per la mia tesi di laurea magistrale.
-
2025
Assessing the Efficacy of a Sequential General Variational Mode Decomposition-Based Combination Model for US Wind Power Forecasting
Modeling Earth Systems and Environment
Sviluppo di un modello combinato basato su tecniche di decomposizione per la previsione di serie temporali relative alla produzione di energia eolica.
Progetti
-
Da un database ICU frammentato a una tabella analitica validata
Sviluppo di circa 900 righe di SQL su Google BigQuery per trasformare un database di terapia intensiva complesso, distribuito su più tabelle, in un’unica tabella analitica validata.
Oggi questa tabella viene utilizzata come fonte dati standard da diversi gruppi dell’Istituto e da ricercatori esterni.
L’automazione delle elaborazioni periodiche e della reportistica ha inoltre ridotto in modo significativo il lavoro manuale richiesto in diversi progetti.
BigQuery · SQL · Python · R
-
SOFA-2: sviluppo dello score pubblicato su JAMA
Ho fatto l’ETL dai record grezzi MargheritaTre (GiViTI), JSON annidato e testo libero, ho calcolato la tabella SOFA-2 e poi le statistiche e le analisi per l’articolo.
Ho partecipato allo studio come coautore nell’ambito di un’ampia collaborazione internazionale tra più istituzioni di ricerca.
Score di gravità · Calibrazione dei modelli · R · SQL
-
Una dashboard interrogabile in linguaggio naturale
Progettazione e sviluppo di una dashboard analitica interattiva con un assistente basato su un modello linguistico.
Lo strumento consente ai ricercatori di esplorare e interrogare i dati dei propri studi usando il linguaggio naturale, invece di dover richiedere ogni volta la scrittura di una query.
La dashboard viene utilizzata nelle attività quotidiane di ricerca e analisi anche da persone che non lavorano abitualmente con SQL.
Python · LangChain · SQL
-
Data engineering per uno studio sulla nutrizione in terapia intensiva
Collaborazione come data engineer a una tesi di specializzazione in Anestesia e Rianimazione dedicata alla gestione della nutrizione artificiale nei pazienti critici ricoverati in terapia intensiva.
Per il progetto ho sviluppato uno strumento di estrazione dati che non richiede programmazione, permettendo al medico di eseguire direttamente le analisi senza competenze specifiche di data management e senza dipendere dal mio intervento.
Estrazione dati · Dati ICU · SQL
-
Anomaly detection per la consulenza finanziaria regolamentata
Sviluppo di un sistema di anomaly detection non supervisionata in Azure Machine Learning per individuare pattern insoliti nei dati relativi alle performance dei consulenti ipotecari e supportare i processi interni di verifica della conformità.
La pipeline in Azure ML. I nuovi dati grezzi vengono puliti e trasformati in feature, un modello addestrato in warm start li valuta, e l’ultimo passo calcola valori SHAP e grafici PCA per la dashboard Power BI su cui lavoravano i supervisori. Parallelamente, ho definito, calcolato e validato oltre 28 KPI aziendali, rendendo i risultati disponibili a manager e responsabili senior tramite dashboard Power BI.
Il modello ha contribuito all’evoluzione dei processi interni di monitoraggio e la metodologia è stata successivamente pubblicata a ICSEM 2025.
Ho inoltre sviluppato pipeline con Azure Python SDK e Spark SQL e, insieme a un collega, ho lavorato alla trasformazione di applicazioni COBOL legacy in servizi web e all’introduzione dell’intelligenza artificiale in alcuni progetti selezionati.
Azure ML · Python · Spark SQL · Power BI
-
Financial Advisor: un sistema decisionale open source
Un sistema locale per valutare decisioni finanziarie familiari sulla base di evidenze aggiornate provenienti da 14 fonti pubbliche, una politica d’investimento formalizzata e una serie di regole che limitano il punteggio quando le evidenze disponibili non sono sufficienti.
Se un’affermazione non è supportata da almeno tre fonti indipendenti e aggiornate, il sistema la mantiene come incerta anziché trasformarla forzatamente in una risposta positiva.
Il progetto è sviluppato in Python utilizzando esclusivamente la libreria standard e comprende 559 test.
Il codice è open source e il contratto per i provider di dati è documentato, in modo che altri possano aggiungere nuove fonti o adattare il sistema a giurisdizioni diverse. Panoramica del progetto (in inglese) · Repository
Python · Public APIs · Claude Code
-
Progetti di studio e sperimentazione
Mapping di record HL7 FHIR R4 verso tabelle di staging con una struttura simile a OMOP in Databricks.
Sviluppo di una pipeline di Natural Language Processing con spaCy, collegata a classificatori XGBoost per la previsione degli outcome.
Sviluppo di un assistente di question answering basato su retrieval su una raccolta privata di documenti, utilizzando LangChain e pgvector. Il sistema mantiene un log tracciabile che permette di risalire alla fonte di ogni risposta.
Ho realizzato questi progetti per acquisire esperienza pratica con queste tecnologie, non per uno studio o un cliente specifico. Nessuno di essi è attualmente utilizzato in produzione: rappresentano aree che voglio approfondire ulteriormente.
Databricks · spaCy · XGBoost · LangChain · pgvector · FastAPI · Docker · MLflow
Percorso professionale
- 2024 — oggiData Scientist
Istituto di Ricerche Farmacologiche Mario Negri, Ranica, Italia - 2023–2024Data Scientist, tirocinio di sei mesi
The Openwork Partnership, Swindon, Regno Unito - 2021–2024Laurea Magistrale in Economics and Data Analysis
Università degli Studi di Bergamo
Assistente alla didattica per il corso di Machine Learning - 20221° posto allo Stat-Hackathon Bergamo, insieme al mio team
Python · R · SAS - 2015Laurea in Business Management
Islamic Azad University, Neyshabur
Competenze e strumenti
- Linguaggi
- Python · R · SQL · Spark SQL
- Statistica
- Test d’ipotesi · Modelli di regressione · Analisi di dati longitudinali · Serie temporali · Analisi multivariata
- Machine Learning
- Metodi supervisionati e non supervisionati · Anomaly detection · Clustering · Feature engineering · Natural Language Processing
- Cloud e data infrastructure
- Google BigQuery · Azure ML · Azure Synapse · Databricks · Power BI
- Deployment e MLOps
- MLflow · FastAPI · Docker · Git · LangChain · Claude Code
- Dati clinici
- GiViTI / MargheritaTre · MIMIC · HL7 FHIR R4 · OMOP
- Lingue
- Persiano — madrelingua
Inglese — livello professionale, C1
Italiano e tedesco — livello base
Restiamo in contatto
Sono disponibile per opportunità di ricerca e industria in Europa, oltre che per dottorati nell’ambito dei dati sanitari.
rasoul@rasoulsamei.com