Data Scientist · Ricerca clinica · Bergamo

Rasoul Samei

Lavoro con dati clinici di terapia intensiva presso l’Istituto Mario Negri. Mi occupo soprattutto di integrare e strutturare database clinici complessi, trasformandoli in dati affidabili e utilizzabili per l’analisi e la ricerca.

Sono attualmente alla ricerca di un dottorato o di una posizione di ricerca nell’ambito dei dati sanitari.

0 h 24 h Respiratorio 3 Coagulazione 1 Fegato 0 Cardiovascolare 3 Rene 2 Neurologico 2 SOFA-2 valore peggiore 11
SOFA-2 nelle prime 24 ore di ricovero in terapia intensiva. Per ciascuno dei sei sistemi d’organo si prende il valore peggiore in quella finestra, e i sei punteggi si sommano in uno. L’ho costruito per l’articolo su JAMA 2025, partendo dai record MargheritaTre (GiViTI), JSON annidato e testo libero, fino a una riga per paziente. I valori qui sono inventati, non dati di pazienti.
Rasoul Samei

Sono un data scientist specializzato nella ricerca clinica e, da novembre 2024, lavoro presso l’Istituto di Ricerche Farmacologiche Mario Negri di Ranica.

Il mio lavoro si concentra soprattutto sui dati di terapia intensiva: integro database clinici complessi, preparo dataset e tabelle analitiche per gli studi di ricerca e svolgo le relative analisi statistiche.

Tra i progetti che ho sviluppato c’è una dashboard analitica con un assistente basato su un modello linguistico, che permette ai ricercatori di interrogare i dati dei propri studi usando il linguaggio naturale.

In un altro progetto, realizzato per una tesi di specializzazione presso l’Università di Bologna, ho progettato uno strumento di estrazione dati che non richiede programmazione, permettendo al medico di eseguire direttamente le analisi sui dati di terapia intensiva senza competenze specifiche di data management e senza dipendere dal mio intervento.

Una parte importante del mio lavoro consiste anche nel capire fino a che punto i dati possano realmente sostenere una conclusione o un’ipotesi. È un aspetto che ho approfondito lavorando a stretto contatto con clinici e statistici.

Prima di entrare al Mario Negri, ho trascorso sei mesi nel Regno Unito presso The Openwork Partnership, dove mi sono occupato di anomaly detection applicata ai dati dei servizi di consulenza finanziaria in un contesto regolamentato.

In precedenza sono stato assistente alla didattica per il corso di Machine Learning presso l’Università degli Studi di Bergamo.

Sono iraniano e vivo a Bergamo.

  • 3pubblicazioni peer-reviewed
  • 900+ righedi SQL in una pipeline operativa su BigQuery
  • 28+ KPIaziendali definiti e validati
  • 1° postoallo Stat-Hackathon Bergamo 2022 con il mio team

I miei principali interessi di ricerca riguardano gli score di gravità, la calibrazione dei modelli e l’analisi di dati longitudinali.

Prima di qualsiasi analisi, però, c’è un passaggio fondamentale: rendere i dati clinici provenienti da più centri sufficientemente coerenti e comparabili da poter formulare domande di ricerca affidabili.

Una parte significativa del mio lavoro si concentra proprio su questo processo.

Finora ho lavorato con dati GiViTI e MIMIC.

  1. 2025
    Development and Validation of the Sequential Organ Failure Assessment (SOFA)-2 Score

    Ranzani OT, Singer M, et al., for the SOFA-2 Collaborators, including Rasoul Samei

    JAMA, 334(23): 2090–2103

    Coautore dello studio. Mi sono occupato dell’estrazione e dell’elaborazione dei dati dal database clinico MargheritaTre (GiViTI), delle analisi statistiche e della revisione del manoscritto.

  2. 2025
    Anomaly Detection in Financial Advisory Services: A Machine Learning Approach for Mortgage Conduct of Business Advisers

    Rasoul Samei

    ICSEM 2025

    Sviluppo di un approccio di anomaly detection non supervisionata applicato ai dati sulle performance dei consulenti ipotecari in un contesto regolamentato. Il sistema è stato sviluppato con Azure Machine Learning per supportare i processi di verifica della conformità ed è nato dal lavoro svolto per la mia tesi di laurea magistrale.

  3. 2025
    Assessing the Efficacy of a Sequential General Variational Mode Decomposition-Based Combination Model for US Wind Power Forecasting

    Shalchilar M, Samei R, et al.

    Modeling Earth Systems and Environment

    Sviluppo di un modello combinato basato su tecniche di decomposizione per la previsione di serie temporali relative alla produzione di energia eolica.

  • Da un database ICU frammentato a una tabella analitica validata

    Istituto Mario Negri · dal 2024

    Sviluppo di circa 900 righe di SQL su Google BigQuery per trasformare un database di terapia intensiva complesso, distribuito su più tabelle, in un’unica tabella analitica validata.

    Oggi questa tabella viene utilizzata come fonte dati standard da diversi gruppi dell’Istituto e da ricercatori esterni.

    L’automazione delle elaborazioni periodiche e della reportistica ha inoltre ridotto in modo significativo il lavoro manuale richiesto in diversi progetti.

    BigQuery · SQL · Python · R

  • SOFA-2: sviluppo dello score pubblicato su JAMA

    Istituto Mario Negri · 2025

    Ho fatto l’ETL dai record grezzi MargheritaTre (GiViTI), JSON annidato e testo libero, ho calcolato la tabella SOFA-2 e poi le statistiche e le analisi per l’articolo.

    Ho partecipato allo studio come coautore nell’ambito di un’ampia collaborazione internazionale tra più istituzioni di ricerca.

    Score di gravità · Calibrazione dei modelli · R · SQL

  • Una dashboard interrogabile in linguaggio naturale

    Istituto Mario Negri · 2025

    Progettazione e sviluppo di una dashboard analitica interattiva con un assistente basato su un modello linguistico.

    Lo strumento consente ai ricercatori di esplorare e interrogare i dati dei propri studi usando il linguaggio naturale, invece di dover richiedere ogni volta la scrittura di una query.

    La dashboard viene utilizzata nelle attività quotidiane di ricerca e analisi anche da persone che non lavorano abitualmente con SQL.

    Python · LangChain · SQL

  • Data engineering per uno studio sulla nutrizione in terapia intensiva

    In collaborazione con l’Università di Bologna

    Collaborazione come data engineer a una tesi di specializzazione in Anestesia e Rianimazione dedicata alla gestione della nutrizione artificiale nei pazienti critici ricoverati in terapia intensiva.

    Per il progetto ho sviluppato uno strumento di estrazione dati che non richiede programmazione, permettendo al medico di eseguire direttamente le analisi senza competenze specifiche di data management e senza dipendere dal mio intervento.

    Estrazione dati · Dati ICU · SQL

  • Anomaly detection per la consulenza finanziaria regolamentata

    The Openwork Partnership · Swindon, Regno Unito · 2023–2024

    Sviluppo di un sistema di anomaly detection non supervisionata in Azure Machine Learning per individuare pattern insoliti nei dati relativi alle performance dei consulenti ipotecari e supportare i processi interni di verifica della conformità.

    Pulizia nuovi dati grezzi Feature engineering variabili derivate Scoring modello addestrato sui nuovi dati Spiegazione valori SHAP grafici PCA Addestramento warm start sui nuovi dati dati grezzi dati di training dashboard Power BI
    La pipeline in Azure ML. I nuovi dati grezzi vengono puliti e trasformati in feature, un modello addestrato in warm start li valuta, e l’ultimo passo calcola valori SHAP e grafici PCA per la dashboard Power BI su cui lavoravano i supervisori.

    Parallelamente, ho definito, calcolato e validato oltre 28 KPI aziendali, rendendo i risultati disponibili a manager e responsabili senior tramite dashboard Power BI.

    Il modello ha contribuito all’evoluzione dei processi interni di monitoraggio e la metodologia è stata successivamente pubblicata a ICSEM 2025.

    Ho inoltre sviluppato pipeline con Azure Python SDK e Spark SQL e, insieme a un collega, ho lavorato alla trasformazione di applicazioni COBOL legacy in servizi web e all’introduzione dell’intelligenza artificiale in alcuni progetti selezionati.

    Azure ML · Python · Spark SQL · Power BI

  • Financial Advisor: un sistema decisionale open source

    Progetto personale · Licenza MIT

    Un sistema locale per valutare decisioni finanziarie familiari sulla base di evidenze aggiornate provenienti da 14 fonti pubbliche, una politica d’investimento formalizzata e una serie di regole che limitano il punteggio quando le evidenze disponibili non sono sufficienti.

    Se un’affermazione non è supportata da almeno tre fonti indipendenti e aggiornate, il sistema la mantiene come incerta anziché trasformarla forzatamente in una risposta positiva.

    Il progetto è sviluppato in Python utilizzando esclusivamente la libreria standard e comprende 559 test.

    Il codice è open source e il contratto per i provider di dati è documentato, in modo che altri possano aggiungere nuove fonti o adattare il sistema a giurisdizioni diverse. Panoramica del progetto (in inglese) · Repository

    Python · Public APIs · Claude Code

  • Progetti di studio e sperimentazione

    In sviluppo

    Mapping di record HL7 FHIR R4 verso tabelle di staging con una struttura simile a OMOP in Databricks.

    Sviluppo di una pipeline di Natural Language Processing con spaCy, collegata a classificatori XGBoost per la previsione degli outcome.

    Sviluppo di un assistente di question answering basato su retrieval su una raccolta privata di documenti, utilizzando LangChain e pgvector. Il sistema mantiene un log tracciabile che permette di risalire alla fonte di ogni risposta.

    Ho realizzato questi progetti per acquisire esperienza pratica con queste tecnologie, non per uno studio o un cliente specifico. Nessuno di essi è attualmente utilizzato in produzione: rappresentano aree che voglio approfondire ulteriormente.

    Databricks · spaCy · XGBoost · LangChain · pgvector · FastAPI · Docker · MLflow

Linguaggi
Python · R · SQL · Spark SQL
Statistica
Test d’ipotesi · Modelli di regressione · Analisi di dati longitudinali · Serie temporali · Analisi multivariata
Machine Learning
Metodi supervisionati e non supervisionati · Anomaly detection · Clustering · Feature engineering · Natural Language Processing
Cloud e data infrastructure
Google BigQuery · Azure ML · Azure Synapse · Databricks · Power BI
Deployment e MLOps
MLflow · FastAPI · Docker · Git · LangChain · Claude Code
Dati clinici
GiViTI / MargheritaTre · MIMIC · HL7 FHIR R4 · OMOP
Lingue
Persiano — madrelingua
Inglese — livello professionale, C1
Italiano e tedesco — livello base

Restiamo in contatto

Sono disponibile per opportunità di ricerca e industria in Europa, oltre che per dottorati nell’ambito dei dati sanitari.

rasoul@rasoulsamei.com