متخصص علم داده · پژوهش بالینی · برگامو، ایتالیا

رسول سامعی

در مؤسسه ماریو نگری روی داده‌های بالینی بخش مراقبت‌های ویژه کار می‌کنم. بخش مهمی از کارم یکپارچه‌سازی و آماده‌سازی پایگاه‌های داده‌ی پراکنده است تا بتوان از آن‌ها برای تحلیل و پاسخ به پرسش‌های پژوهشی استفاده کرد.

در حال حاضر به‌دنبال فرصت دکتری یا موقعیت پژوهشی در حوزه‌ی داده‌های سلامت هستم.

SOFA-2 score ۲ روز ۱ روز ۱۴
نمونه‌ای فرضی از روند امتیاز SOFA-2 طی ۱۴ روز بستری در ICU. این نمودار صرفاً برای نمایش است و از داده‌ی واقعی بیمار استفاده نمی‌کند.
رسول سامعی

متخصص علم داده در حوزه‌ی پژوهش‌های بالینی هستم و از نوامبر ۲۰۲۴ در مؤسسه تحقیقات داروشناسی ماریو نگری در رانیکا فعالیت می‌کنم. تمرکز اصلی کارم بر داده‌های مراقبت‌های ویژه است: پایگاه‌های داده‌ی بالینی پراکنده را یکپارچه می‌کنم، جداول تحلیلی موردنیاز مطالعات پژوهشی را می‌سازم و تحلیل‌های آماری مرتبط را انجام می‌دهم.

یکی از پروژه‌هایم توسعه‌ی یک داشبورد تحلیلی با دستیار مبتنی بر مدل زبانی بود که به پژوهشگران اجازه می‌دهد با زبان طبیعی از داده‌های مطالعات خود سؤال کنند. در پروژه‌ای دیگر، برای یک پایان‌نامه‌ی دوره‌ی تخصصی در دانشگاه بولونیا، ابزاری بدون نیاز به کدنویسی برای استخراج داده طراحی کردم تا پزشک بتواند تحلیل داده‌های ICU را بدون پیش‌زمینه‌ی مدیریت داده و بدون نیاز به حضور من در مراحل اجرایی انجام دهد.

بخش مهم دیگری از کارم این است که مشخص کنم داده‌ها واقعاً تا چه حد می‌توانند از یک نتیجه یا فرضیه پشتیبانی کنند؛ مهارتی که در همکاری نزدیک با پزشکان و متخصصان آمار به دست آورده‌ام.

پیش از پیوستن به ماریو نگری، شش ماه در بریتانیا و در The Openwork Partnership روی تشخیص ناهنجاری در داده‌های خدمات مشاوره‌ی مالی تحت مقررات کار کردم. قبل از آن نیز در دانشگاه برگامو دستیار آموزشی درس یادگیری ماشین بودم.

ایرانی هستم و در برگامو زندگی می‌کنم.

  • ۳مقاله‌ی داوری‌شده
  • بیش از ۹۰۰خط SQL در یک پایپ‌لاین عملیاتی BigQuery
  • بیش از ۲۸شاخص کلیدی کسب‌وکار، تعریف و اعتبارسنجی‌شده
  • رتبه‌ی اولStat-Hackathon برگامو ۲۰۲۲، به همراه تیمم

حوزه‌های اصلی کار پژوهشی من شامل امتیازهای شدت بیماری، کالیبراسیون مدل‌ها و تحلیل داده‌های طولی است.

اما پیش از هر تحلیلی، یک چالش اساسی وجود دارد: داده‌های بالینی چندمرکزی باید به‌اندازه‌ای یکپارچه و قابل‌مقایسه شوند که اساساً بتوان یک پرسش پژوهشی معتبر از آن‌ها مطرح کرد. بخش زیادی از کار من دقیقاً روی همین مرحله متمرکز است.

تا امروز با داده‌های GiViTI و MIMIC کار کرده‌ام.

  1. ۲۰۲۵
    Development and Validation of the Sequential Organ Failure Assessment (SOFA)-2 Score

    Ranzani OT, Singer M, et al., for the SOFA-2 Collaborators, including Rasoul Samei

    JAMA, 334(23): 2090–2103

    از نویسندگان همکار مقاله. مسئولیت‌های من شامل استخراج و پردازش داده‌های پایگاه بالینی MargheritaTre (GiViTI)، انجام تحلیل‌های آماری و مشارکت در بازبینی مقاله بود.

  2. ۲۰۲۵
    Anomaly Detection in Financial Advisory Services: A Machine Learning Approach for Mortgage Conduct of Business Advisers

    Rasoul Samei

    ICSEM 2025

    توسعه‌ی یک روش تشخیص ناهنجاری بدون‌ناظر برای داده‌های مربوط به عملکرد مشاوران وام مسکن در محیطی تحت مقررات. این سیستم با Azure Machine Learning و با هدف پشتیبانی از فرایندهای بررسی انطباق با مقررات توسعه یافت و بر پایه‌ی پایان‌نامه‌ی کارشناسی ارشد من شکل گرفت.

  3. ۲۰۲۵
    Assessing the Efficacy of a Sequential General Variational Mode Decomposition-Based Combination Model for US Wind Power Forecasting

    Shalchilar M, Samei R, et al.

    Modeling Earth Systems and Environment

    توسعه‌ی یک مدل ترکیبی مبتنی بر روش‌های تجزیه برای پیش‌بینی سری زمانی تولید برق بادی.

  • از یک پایگاه داده‌ی پراکنده‌ی ICU تا یک جدول تحلیلی معتبر

    مؤسسه ماریو نگری · ۲۰۲۴ تا امروز

    توسعه‌ی حدود ۹۰۰ خط SQL در Google BigQuery برای تبدیل یک پایگاه داده‌ی مراقبت‌های ویژه با ساختاری پیچیده و چندجدولی به یک جدول تحلیلی واحد و اعتبارسنجی‌شده.

    این جدول اکنون به‌عنوان یکی از منابع استاندارد داده، هم توسط تیم‌های مختلف مؤسسه و هم پژوهشگران خارج از آن استفاده می‌شود. خودکارسازی پردازش‌های دوره‌ای و فرایند گزارش‌گیری نیز حجم قابل‌توجهی از کار دستی را در چند پروژه کاهش داده است.

    BigQuery · SQL · Python · R

  • توسعه‌ی امتیاز SOFA-2، منتشرشده در JAMA

    مؤسسه ماریو نگری · ۲۰۲۵

    استخراج و پردازش داده‌های پایگاه MargheritaTre (GiViTI)، انجام تحلیل‌های آماری و مشارکت در بازبینی مقاله برای نسخه‌ی به‌روزشده‌ی امتیاز Sequential Organ Failure Assessment یا SOFA.

    به‌عنوان یکی از نویسندگان همکار در این پژوهش حضور داشتم. این مطالعه حاصل یک همکاری بین‌المللی گسترده میان چندین مؤسسه‌ی پژوهشی بود.

    امتیازهای شدت بیماری · کالیبراسیون مدل · R · SQL

  • داشبوردی که پژوهشگران می‌توانند مستقیماً از آن سؤال کنند

    مؤسسه ماریو نگری · ۲۰۲۵

    طراحی و توسعه‌ی یک داشبورد تحلیلی تعاملی با دستیار مبتنی بر مدل زبانی. این ابزار به پژوهشگران اجازه می‌دهد به‌جای درخواست برای نوشتن کوئری، با زبان طبیعی داده‌های مطالعه‌ی خود را بررسی و تحلیل کنند.

    این داشبورد در فعالیت‌های روزمره‌ی پژوهشی و تحلیلی مؤسسه توسط افرادی استفاده می‌شود که لزوماً با SQL کار نمی‌کنند.

    Python · LangChain · SQL

  • مهندسی داده برای یک مطالعه‌ی تغذیه‌درمانی در ICU

    با همکاری دانشگاه بولونیا

    به‌عنوان مهندس داده در یک پایان‌نامه‌ی دوره‌ی تخصصی بیهوشی و مراقبت‌های ویژه درباره‌ی مدیریت تغذیه‌درمانی بیماران بدحال بستری در ICU همکاری کردم.

    برای این پروژه، یک کاربرگ استخراج داده‌ی بدون نیاز به کدنویسی طراحی کردم تا پزشک بتواند فرایند تحلیل را مستقیماً اجرا کند؛ بدون اینکه به پیش‌زمینه‌ای در مدیریت داده یا حضور من در هر مرحله نیاز داشته باشد.

    استخراج داده · داده‌های ICU · SQL

  • تشخیص ناهنجاری در خدمات مشاوره‌ی مالی تحت مقررات

    The Openwork Partnership · سویندون، بریتانیا · ۲۰۲۳–۲۰۲۴

    توسعه‌ی یک سیستم تشخیص ناهنجاری بدون‌ناظر در Azure Machine Learning برای شناسایی الگوهای غیرمعمول در داده‌های مربوط به عملکرد مشاوران وام مسکن، با هدف کمک به فرایند بررسی انطباق با مقررات.

    در کنار این سیستم، بیش از ۲۸ شاخص کلیدی کسب‌وکار را تعریف، محاسبه و اعتبارسنجی کردم. نتایج از طریق داشبوردهای Power BI در اختیار مدیران و ناظران ارشد قرار می‌گرفت.

    این مدل به توسعه‌ی فرایندهای نظارتی شرکت کمک کرد و روش آن در کنفرانس ICSEM 2025 منتشر شد.

    همچنین پایپ‌لاین‌هایی با Azure Python SDK و Spark SQL توسعه دادم و همراه یکی از همکارانم روی تبدیل برنامه‌های قدیمی COBOL به سرویس‌های تحت وب و استفاده از هوش مصنوعی در برخی پروژه‌های منتخب کار کردم.

    Azure ML · Python · Spark SQL · Power BI

  • Financial Advisor؛ یک سیستم تصمیم‌گیری متن‌باز

    پروژه شخصی · مجوز MIT

    یک سیستم محلی برای ارزیابی تصمیم‌های مالی خانوار بر اساس شواهد تاریخ‌دار از ۱۴ منبع عمومی، یک سیاست سرمایه‌گذاری مکتوب و مجموعه‌ای از قواعد کنترلی که در صورت ناکافی بودن شواهد، سقف امتیاز را محدود می‌کنند.

    در این سیستم، ادعایی که دست‌کم سه منبع مستقل و به‌روز از آن پشتیبانی نکنند، به‌جای آنکه به یک پاسخ مثبت تبدیل شود، در وضعیت «نامشخص» باقی می‌ماند.

    این پروژه با Python و تنها با استفاده از کتابخانه‌ی استاندارد آن توسعه یافته و ۵۵۹ تست دارد. کد پروژه متن‌باز است و قرارداد مربوط به ارائه‌دهندگان داده نیز مستند شده تا افراد دیگر بتوانند منابع داده یا حوزه‌های قضایی جدیدی به آن اضافه کنند. مرور پروژه · مخزن کد

    Python · Public APIs · Claude Code

  • پروژه‌های یادگیری و آزمایش

    در حال توسعه

    نگاشت رکوردهای HL7 FHIR R4 به جداول staging با ساختاری مشابه OMOP در Databricks.

    توسعه‌ی یک پایپ‌لاین پردازش زبان طبیعی با spaCy که خروجی آن به طبقه‌بندهای XGBoost برای پیش‌بینی پیامدها متصل می‌شود.

    توسعه‌ی یک دستیار پرسش‌وپاسخ مبتنی بر بازیابی اطلاعات روی مجموعه‌ای خصوصی از اسناد با استفاده از LangChain و pgvector. این سیستم یک لاگ قابل‌ردیابی نگه می‌دارد تا منبع هر پاسخ مشخص باشد.

    این پروژه‌ها را برای یادگیری عملی این فناوری‌ها ساخته‌ام، نه برای یک مطالعه یا مشتری مشخص. هیچ‌یک در محیط عملیاتی مورد استفاده قرار نمی‌گیرند؛ آن‌ها حوزه‌هایی هستند که می‌خواهم در ادامه بیشتر رویشان کار کنم.

    Databricks · spaCy · XGBoost · LangChain · pgvector · FastAPI · Docker · MLflow

  • ۲۰۲۴ تا امروزمتخصص علم داده، مؤسسه تحقیقات داروشناسی ماریو نگری، رانیکا، ایتالیا
  • ۲۰۲۳–۲۰۲۴متخصص علم داده، دوره‌ی کارآموزی شش‌ماهه، The Openwork Partnership، سویندون، بریتانیا
  • ۲۰۲۱–۲۰۲۴کارشناسی ارشد اقتصاد و تحلیل داده، دانشگاه برگامو
    دستیار آموزشی درس یادگیری ماشین
  • ۲۰۲۲رتبه‌ی اول Stat-Hackathon برگامو به همراه تیمم
    Python · R · SAS
  • ۲۰۱۵کارشناسی مدیریت بازرگانی، دانشگاه آزاد اسلامی نیشابور
زبان‌های برنامه‌نویسی
Python، R، SQL، Spark SQL
آمار
آزمون فرض، مدل‌سازی رگرسیون، تحلیل داده‌های طولی، تحلیل سری‌های زمانی، تحلیل چندمتغیره
یادگیری ماشین
روش‌های باناظر و بدون‌ناظر، تشخیص ناهنجاری، خوشه‌بندی، مهندسی ویژگی، پردازش زبان طبیعی (NLP)
زیرساخت ابری و داده
Google BigQuery، Azure ML، Azure Synapse، Databricks، Power BI
استقرار و عملیاتی‌سازی مدل‌ها
MLflow، FastAPI، Docker، Git، LangChain، Claude Code
داده‌های بالینی
GiViTI / MargheritaTre، MIMIC، HL7 FHIR R4، OMOP
زبان‌ها
فارسی — زبان مادری
انگلیسی — سطح حرفه‌ای، IELTS 7.5
ایتالیایی و آلمانی — مقدماتی

در تماس باشیم

برای موقعیت‌های پژوهشی و صنعتی در سراسر اروپا و همچنین فرصت‌های دکتری در حوزه‌ی داده‌های سلامت آماده‌ی همکاری هستم.

rasoul@rasoulsamei.com