متخصص علم داده · پژوهش بالینی · برگامو، ایتالیا
رسول سامعی
در مؤسسه ماریو نگری روی دادههای بالینی بخش مراقبتهای ویژه کار میکنم. بخش مهمی از کارم یکپارچهسازی و آمادهسازی پایگاههای دادهی پراکنده است تا بتوان از آنها برای تحلیل و پاسخ به پرسشهای پژوهشی استفاده کرد.
در حال حاضر بهدنبال فرصت دکتری یا موقعیت پژوهشی در حوزهی دادههای سلامت هستم.
درباره من
متخصص علم داده در حوزهی پژوهشهای بالینی هستم و از نوامبر ۲۰۲۴ در مؤسسه تحقیقات داروشناسی ماریو نگری در رانیکا فعالیت میکنم. تمرکز اصلی کارم بر دادههای مراقبتهای ویژه است: پایگاههای دادهی بالینی پراکنده را یکپارچه میکنم، جداول تحلیلی موردنیاز مطالعات پژوهشی را میسازم و تحلیلهای آماری مرتبط را انجام میدهم.
یکی از پروژههایم توسعهی یک داشبورد تحلیلی با دستیار مبتنی بر مدل زبانی بود که به پژوهشگران اجازه میدهد با زبان طبیعی از دادههای مطالعات خود سؤال کنند. در پروژهای دیگر، برای یک پایاننامهی دورهی تخصصی در دانشگاه بولونیا، ابزاری بدون نیاز به کدنویسی برای استخراج داده طراحی کردم تا پزشک بتواند تحلیل دادههای ICU را بدون پیشزمینهی مدیریت داده و بدون نیاز به حضور من در مراحل اجرایی انجام دهد.
بخش مهم دیگری از کارم این است که مشخص کنم دادهها واقعاً تا چه حد میتوانند از یک نتیجه یا فرضیه پشتیبانی کنند؛ مهارتی که در همکاری نزدیک با پزشکان و متخصصان آمار به دست آوردهام.
پیش از پیوستن به ماریو نگری، شش ماه در بریتانیا و در The Openwork Partnership روی تشخیص ناهنجاری در دادههای خدمات مشاورهی مالی تحت مقررات کار کردم. قبل از آن نیز در دانشگاه برگامو دستیار آموزشی درس یادگیری ماشین بودم.
ایرانی هستم و در برگامو زندگی میکنم.
- ۳مقالهی داوریشده
- بیش از ۹۰۰خط SQL در یک پایپلاین عملیاتی BigQuery
- بیش از ۲۸شاخص کلیدی کسبوکار، تعریف و اعتبارسنجیشده
- رتبهی اولStat-Hackathon برگامو ۲۰۲۲، به همراه تیمم
پژوهش
حوزههای اصلی کار پژوهشی من شامل امتیازهای شدت بیماری، کالیبراسیون مدلها و تحلیل دادههای طولی است.
اما پیش از هر تحلیلی، یک چالش اساسی وجود دارد: دادههای بالینی چندمرکزی باید بهاندازهای یکپارچه و قابلمقایسه شوند که اساساً بتوان یک پرسش پژوهشی معتبر از آنها مطرح کرد. بخش زیادی از کار من دقیقاً روی همین مرحله متمرکز است.
تا امروز با دادههای GiViTI و MIMIC کار کردهام.
-
۲۰۲۵
Development and Validation of the Sequential Organ Failure Assessment (SOFA)-2 Score
JAMA, 334(23): 2090–2103
از نویسندگان همکار مقاله. مسئولیتهای من شامل استخراج و پردازش دادههای پایگاه بالینی MargheritaTre (GiViTI)، انجام تحلیلهای آماری و مشارکت در بازبینی مقاله بود.
-
۲۰۲۵
Anomaly Detection in Financial Advisory Services: A Machine Learning Approach for Mortgage Conduct of Business Advisers
ICSEM 2025
توسعهی یک روش تشخیص ناهنجاری بدونناظر برای دادههای مربوط به عملکرد مشاوران وام مسکن در محیطی تحت مقررات. این سیستم با Azure Machine Learning و با هدف پشتیبانی از فرایندهای بررسی انطباق با مقررات توسعه یافت و بر پایهی پایاننامهی کارشناسی ارشد من شکل گرفت.
-
۲۰۲۵
Assessing the Efficacy of a Sequential General Variational Mode Decomposition-Based Combination Model for US Wind Power Forecasting
Modeling Earth Systems and Environment
توسعهی یک مدل ترکیبی مبتنی بر روشهای تجزیه برای پیشبینی سری زمانی تولید برق بادی.
پروژهها
-
از یک پایگاه دادهی پراکندهی ICU تا یک جدول تحلیلی معتبر
توسعهی حدود ۹۰۰ خط SQL در Google BigQuery برای تبدیل یک پایگاه دادهی مراقبتهای ویژه با ساختاری پیچیده و چندجدولی به یک جدول تحلیلی واحد و اعتبارسنجیشده.
این جدول اکنون بهعنوان یکی از منابع استاندارد داده، هم توسط تیمهای مختلف مؤسسه و هم پژوهشگران خارج از آن استفاده میشود. خودکارسازی پردازشهای دورهای و فرایند گزارشگیری نیز حجم قابلتوجهی از کار دستی را در چند پروژه کاهش داده است.
BigQuery · SQL · Python · R
-
توسعهی امتیاز SOFA-2، منتشرشده در JAMA
استخراج و پردازش دادههای پایگاه MargheritaTre (GiViTI)، انجام تحلیلهای آماری و مشارکت در بازبینی مقاله برای نسخهی بهروزشدهی امتیاز Sequential Organ Failure Assessment یا SOFA.
بهعنوان یکی از نویسندگان همکار در این پژوهش حضور داشتم. این مطالعه حاصل یک همکاری بینالمللی گسترده میان چندین مؤسسهی پژوهشی بود.
امتیازهای شدت بیماری · کالیبراسیون مدل · R · SQL
-
داشبوردی که پژوهشگران میتوانند مستقیماً از آن سؤال کنند
طراحی و توسعهی یک داشبورد تحلیلی تعاملی با دستیار مبتنی بر مدل زبانی. این ابزار به پژوهشگران اجازه میدهد بهجای درخواست برای نوشتن کوئری، با زبان طبیعی دادههای مطالعهی خود را بررسی و تحلیل کنند.
این داشبورد در فعالیتهای روزمرهی پژوهشی و تحلیلی مؤسسه توسط افرادی استفاده میشود که لزوماً با SQL کار نمیکنند.
Python · LangChain · SQL
-
مهندسی داده برای یک مطالعهی تغذیهدرمانی در ICU
بهعنوان مهندس داده در یک پایاننامهی دورهی تخصصی بیهوشی و مراقبتهای ویژه دربارهی مدیریت تغذیهدرمانی بیماران بدحال بستری در ICU همکاری کردم.
برای این پروژه، یک کاربرگ استخراج دادهی بدون نیاز به کدنویسی طراحی کردم تا پزشک بتواند فرایند تحلیل را مستقیماً اجرا کند؛ بدون اینکه به پیشزمینهای در مدیریت داده یا حضور من در هر مرحله نیاز داشته باشد.
استخراج داده · دادههای ICU · SQL
-
تشخیص ناهنجاری در خدمات مشاورهی مالی تحت مقررات
توسعهی یک سیستم تشخیص ناهنجاری بدونناظر در Azure Machine Learning برای شناسایی الگوهای غیرمعمول در دادههای مربوط به عملکرد مشاوران وام مسکن، با هدف کمک به فرایند بررسی انطباق با مقررات.
در کنار این سیستم، بیش از ۲۸ شاخص کلیدی کسبوکار را تعریف، محاسبه و اعتبارسنجی کردم. نتایج از طریق داشبوردهای Power BI در اختیار مدیران و ناظران ارشد قرار میگرفت.
این مدل به توسعهی فرایندهای نظارتی شرکت کمک کرد و روش آن در کنفرانس ICSEM 2025 منتشر شد.
همچنین پایپلاینهایی با Azure Python SDK و Spark SQL توسعه دادم و همراه یکی از همکارانم روی تبدیل برنامههای قدیمی COBOL به سرویسهای تحت وب و استفاده از هوش مصنوعی در برخی پروژههای منتخب کار کردم.
Azure ML · Python · Spark SQL · Power BI
-
Financial Advisor؛ یک سیستم تصمیمگیری متنباز
یک سیستم محلی برای ارزیابی تصمیمهای مالی خانوار بر اساس شواهد تاریخدار از ۱۴ منبع عمومی، یک سیاست سرمایهگذاری مکتوب و مجموعهای از قواعد کنترلی که در صورت ناکافی بودن شواهد، سقف امتیاز را محدود میکنند.
در این سیستم، ادعایی که دستکم سه منبع مستقل و بهروز از آن پشتیبانی نکنند، بهجای آنکه به یک پاسخ مثبت تبدیل شود، در وضعیت «نامشخص» باقی میماند.
این پروژه با Python و تنها با استفاده از کتابخانهی استاندارد آن توسعه یافته و ۵۵۹ تست دارد. کد پروژه متنباز است و قرارداد مربوط به ارائهدهندگان داده نیز مستند شده تا افراد دیگر بتوانند منابع داده یا حوزههای قضایی جدیدی به آن اضافه کنند. مرور پروژه · مخزن کد
Python · Public APIs · Claude Code
-
پروژههای یادگیری و آزمایش
نگاشت رکوردهای HL7 FHIR R4 به جداول staging با ساختاری مشابه OMOP در Databricks.
توسعهی یک پایپلاین پردازش زبان طبیعی با spaCy که خروجی آن به طبقهبندهای XGBoost برای پیشبینی پیامدها متصل میشود.
توسعهی یک دستیار پرسشوپاسخ مبتنی بر بازیابی اطلاعات روی مجموعهای خصوصی از اسناد با استفاده از LangChain و pgvector. این سیستم یک لاگ قابلردیابی نگه میدارد تا منبع هر پاسخ مشخص باشد.
این پروژهها را برای یادگیری عملی این فناوریها ساختهام، نه برای یک مطالعه یا مشتری مشخص. هیچیک در محیط عملیاتی مورد استفاده قرار نمیگیرند؛ آنها حوزههایی هستند که میخواهم در ادامه بیشتر رویشان کار کنم.
Databricks · spaCy · XGBoost · LangChain · pgvector · FastAPI · Docker · MLflow
مسیر حرفهای
- ۲۰۲۴ تا امروزمتخصص علم داده، مؤسسه تحقیقات داروشناسی ماریو نگری، رانیکا، ایتالیا
- ۲۰۲۳–۲۰۲۴متخصص علم داده، دورهی کارآموزی ششماهه، The Openwork Partnership، سویندون، بریتانیا
- ۲۰۲۱–۲۰۲۴کارشناسی ارشد اقتصاد و تحلیل داده، دانشگاه برگامو
دستیار آموزشی درس یادگیری ماشین - ۲۰۲۲رتبهی اول Stat-Hackathon برگامو به همراه تیمم
Python · R · SAS - ۲۰۱۵کارشناسی مدیریت بازرگانی، دانشگاه آزاد اسلامی نیشابور
ابزارها و مهارتها
- زبانهای برنامهنویسی
- Python، R، SQL، Spark SQL
- آمار
- آزمون فرض، مدلسازی رگرسیون، تحلیل دادههای طولی، تحلیل سریهای زمانی، تحلیل چندمتغیره
- یادگیری ماشین
- روشهای باناظر و بدونناظر، تشخیص ناهنجاری، خوشهبندی، مهندسی ویژگی، پردازش زبان طبیعی (NLP)
- زیرساخت ابری و داده
- Google BigQuery، Azure ML، Azure Synapse، Databricks، Power BI
- استقرار و عملیاتیسازی مدلها
- MLflow، FastAPI، Docker، Git، LangChain، Claude Code
- دادههای بالینی
- GiViTI / MargheritaTre، MIMIC، HL7 FHIR R4، OMOP
- زبانها
- فارسی — زبان مادری
انگلیسی — سطح حرفهای، IELTS 7.5
ایتالیایی و آلمانی — مقدماتی
در تماس باشیم
برای موقعیتهای پژوهشی و صنعتی در سراسر اروپا و همچنین فرصتهای دکتری در حوزهی دادههای سلامت آمادهی همکاری هستم.
rasoul@rasoulsamei.com