برنامه‌ریزی مجدد حمل و نقل بار Synchromodal تحت عدم قطعیت زمان سرویس: یک یادگیری تقویتی به کمک مدل آنلاین

برنامه‌ریزی مجدد حمل و نقل بار Synchromodal تحت عدم قطعیت زمان سرویس: یک یادگیری تقویتی به کمک مدل آنلاین

هدف این مطالعه، پرداختن به مسئله عدم قطعیت زمان سرویس در حمل و نقل بار همزمان است که می‌تواند باعث تاخیر، ناکارآمدی و کاهش رضایت حمل‌کنندگان شود. راه‌حل پیشنهادی، یک رویکرد یادگیری تقویتی عمیق آنلاین (RL) است که عدم قطعیت زمان سرویس را در نظر می‌گیرد و با کمک یک روش اکتشافی جستجوی محله بزرگ تطبیقی ​​(ALNS) که اطلاعات وضعیت و پاداش را بر اساس مسیریابی و زمان‌بندی ارائه می‌دهد، پشتیبانی می‌شود. رویکرد برنامه‌ریزی پیشنهادی در پاسخ به رویدادهای غیرمنتظره برنامه‌ریزی مجدد می‌کند و از اطلاعات بلادرنگ از حالت‌های مختلف حمل و نقل، از جمله جاده، راه‌آهن و آبراه‌های داخلی، یاد می‌گیرد. عملکرد رویکرد برنامه‌ریزی پیشنهادی در کریدور راین-آلپین اروپا تحت سناریوهای مختلف با انواع و شدت‌های مختلف رویدادهای غیرمنتظره ارزیابی می‌شود. نتایج نشان می‌دهد که رویکرد RL با مدیریت مؤثر عدم قطعیت زمان سرویس، که منجر به کاهش هزینه‌ها، انتشار گازهای گلخانه‌ای و زمان انتظار و همچنین کاهش تاخیرهای حمل و نقل و بهبود پاداش‌ها از طریق تصمیم‌گیری دقیق و برنامه‌ریزی مجدد حمل و نقل چابک می‌شود، به طور مداوم از سایر استراتژی‌ها بهتر عمل می‌کند. این مطالعه همچنین نشان می‌دهد که گنجاندن اطلاعات شدت رویداد، میانگین پاداش به‌دست‌آمده از رویکرد یادگیری تقویتی را در سناریوهایی که شامل انواع مختلفی از رویدادها هستند، بهبود می‌بخشد.

مقدمه

حمل و نقل بار سینکرومودال، نسخه پیشرفته‌ای از حمل و نقل بار بین‌وجهی است که با استفاده از چندین حالت (مانند جاده، راه‌آهن و آبراه داخلی) در ترکیب با به‌روزرسانی‌های بلادرنگ، پتانسیل ارائه خدمات کم‌هزینه، قابل اعتماد و پایدار را دارد (Tavasszy و همکاران، 2017؛ Li و همکاران، 2017؛ Zhang و همکاران، 2022b؛ Zhang و همکاران، 2022a). با این حال، برنامه‌ریزی حمل و نقل سینکرومودال اغلب با عدم قطعیت‌های مختلفی مانند عدم قطعیت زمان سرویس مواجه است که می‌تواند به طور قابل توجهی بر کارایی سیستم حمل و نقل تأثیر بگذارد (SteadieSeifi و همکاران، 2014؛ Delbart و همکاران، 2021). زمان سرویس در حمل و نقل سینکرومودال به مدت زمان برداشت، تحویل یا انتقال کالا در ترمینال‌ها، از جمله زمان بارگیری/تخلیه و فعالیت‌های مرتبط اشاره دارد. حمل و نقل سینکرومودال برای انتقال یکپارچه و کارآمد کالا بین حالت‌ها تلاش می‌کند، با این حال، عدم قطعیت زمان سرویس در ترمینال‌ها که ناشی از رویدادهای غیرمنتظره است، چالش مهمی را برای دستیابی به این هدف ایجاد می‌کند. رویدادهای غیرمنتظره، مانند ازدحام، آب و هوای بد و نقص تجهیزات، می‌توانند باعث زمان انتظار طولانی یا تغییر در مدت زمان سرویس شوند و منجر به عدم قطعیت در زمان سرویس شوند. این عدم قطعیت می‌تواند باعث تاخیرها و برنامه‌های حمل و نقل غیرعملی شود که منجر به راندمان پایین، هزینه بالا و لغو درخواست می‌شود. یکی از وظایف ضروری حمل و نقل بار همزمان، سازگاری با عدم قطعیت زمان سرویس در پایانه‌ها (از جمله بنادر، ایستگاه‌های قطار/کامیون و پایانه‌های حمل و نقل) است.

برای مقابله با مشکلات برنامه‌ریزی حمل و نقل در شرایط عدم قطعیت، اکثر رویکردهای موجود در ادبیات مبتنی بر بهینه‌سازی استوار (Abbassi و همکاران، ۲۰۱۹)، برنامه‌ریزی مجدد یا برنامه‌ریزی تصادفی (Guo و همکاران، ۲۰۲۱) هستند. بهینه‌سازی استوار، راه‌حل‌ها را با استفاده از بدترین حالت تحقق پارامترهای نامشخص ارزیابی می‌کند و ممکن است ظرفیت‌های اضافی بلااستفاده ایجاد کند (Gabrel و همکاران، ۲۰۱۴). برنامه‌ریزی مجدد به تنظیم برنامه‌ها و زمان‌بندی‌های حمل و نقل در پاسخ به رویدادهای غیرمنتظره اشاره دارد. برنامه‌ریزی مجدد معمولاً پس از تأخیرهای قابل توجه و بدون پیش‌بینی زمان و مدت تأخیر انجام می‌شود. رویکردهای برنامه‌ریزی تصادفی به فرضیات قبلی در مورد توزیع احتمال برای زمان یا تقاضای سفر متکی هستند. آنها انحرافات احتمالی از توزیع فرضی را در نظر نمی‌گیرند (Farahani و همکاران، ۲۰۲۱). این رویکردها معمولاً فرض می‌کنند که اطلاعات توزیع در مورد عدم قطعیت، قبل از انجام هر اقدامی، از قبل در دسترس است. این همیشه یک فرض واقع‌بینانه نیست زیرا اطلاعات در مورد عدم قطعیت معمولاً به تدریج در طول فرآیند حمل و نقل آشکار می‌شود. علاوه بر این، استفاده از توزیع‌های تاریخی بدون تشخیص تغییرات در یک محیط، ممکن است عملکرد برنامه‌ریزی را کاهش دهد (فیبونباناکیت و همکاران، 2021). بنابراین، یک توانایی یادگیری پویا که مدل برنامه‌ریزی را به‌روزرسانی کند، برای مقابله با عدم قطعیت در محیط مورد نیاز است.

مسائل زمان‌بندی و مسیریابی آنلاین به طور طبیعی در بسیاری از حوزه‌های کاربردی مطرح می‌شوند و در سال‌های اخیر توجه فزاینده‌ای را به خود جلب کرده‌اند. برخلاف بهینه‌سازی آفلاین، در بهینه‌سازی آنلاین، داده‌ها از قبل در دسترس فرض نمی‌شوند. بلکه در طول اجرای الگوریتم جمع‌آوری می‌شوند (بنت و ون هنتنریک، ۲۰۰۵). به لطف توسعه پلتفرم‌های دیجیتال و ظهور مفاهیمی مانند حمل و نقل همزمان، یک شرکت حمل و نقل بیش از پیش قادر به جمع‌آوری اطلاعات بلادرنگ از شبکه حمل و نقل (از طریق مقامات بندر، اپراتورهای ترمینال و/یا حسگرها) در مورد عدم قطعیت‌ها است.

پیچیدگی و اندازه یک شبکه حمل و نقل، حفظ و یادگیری از رویدادها را برای شرکت‌های حمل و نقل دشوار می‌کند. مدل‌ها و الگوریتم‌های پیشرفته، به ویژه یادگیری تقویتی عمیق (RL)، پتانسیل این را دارند که در مدیریت رویدادهای غیرمنتظره مفید باشند. ثابت شده است که یادگیری تقویتی می‌تواند در کارهایی مانند بازی‌های آتاری (Mnih و همکاران، ۲۰۱۵) و بازی Go (Silver و همکاران، ۲۰۱۸) به مهارت‌های انسانی یا فوق بشری دست یابد. در حمل و نقل بار همزمان، الگوی عدم قطعیت زمان سرویس به نظم‌ها یا ارتباطاتی اشاره دارد که مربوط به عواملی هستند که بر مدت زمان سرویس تأثیر می‌گذارند. چنین عواملی شامل اما نه محدود به آنها، نحوه حمل و نقل، زمان فعلی، ترمینال و نوع رویداد می‌شوند. اطلاعات جمع‌آوری شده از مقامات بندر، اپراتورهای ترمینال و حسگرها را می‌توان برای یادگیری الگوی عدم قطعیت‌ها توسط یادگیری تقویتی استفاده کرد. یادگیری تقویتی با یادگیری آنلاین می‌تواند عدم قطعیت را مدیریت کند و به اپراتورها کمک کند تا در یک چارچوب برنامه‌ریزی مجدد، تصمیمات بهتری بگیرند. برخلاف روش‌های سنتی برنامه‌ریزی مجدد که فاقد مؤلفه یادگیری تطبیقی ​​هستند، استفاده از یادگیری تقویتی برای برنامه‌ریزی مجدد، امکان یادگیری از تجربه و تنظیم برنامه‌های حمل و نقل را بر اساس آن با استفاده از سیاست‌های به‌روزرسانی‌شده مداوم فراهم می‌کند.

به طور گسترده پذیرفته شده است که الگوریتم‌های یادگیری تقویتی (RL) به دلیل «نفرین ابعاد» (Gosavi, 2009) می‌توانند برای پیاده‌سازی چالش برانگیز باشند. این اصطلاح به دشواری آموزش عوامل یادگیری تقویتی زمانی اشاره دارد که ابعاد حالت محیط یا اقدام کنترلی بالا باشد. این چالش در زمینه برنامه‌ریزی حمل و نقل همزمان-وجهی، که به دلیل نیاز به در نظر گرفتن مسیریابی و زمان‌بندی در چندین حالت حمل و نقل، همانطور که در شکل 1 نشان داده شده است، شامل یک فضای حالت بزرگ است، پیچیده‌تر می‌شود. تصمیمات در حمل و نقل همزمان-وجهی نیز پیچیده هستند که شامل اقدامات گسسته (به عنوان مثال، انتخاب وسیله نقلیه) و اقدامات پیوسته (به عنوان مثال، زمان‌بندی حمل و نقل) می‌شوند. برای پرداختن به این چالش‌ها و افزایش همگرایی آموزش یادگیری تقویتی، در این مقاله یک رویکرد یادگیری تقویتی با کمک مدل پیشنهاد می‌کنیم. به جای تکیه صرف بر عامل یادگیری تقویتی برای تصمیم‌گیری‌های کنترلی بدون راهنمایی، ما یک مدل برنامه‌ریزی حمل و نقل را برای ارائه کمک ادغام می‌کنیم. به طور خاص، ما از جستجوی تطبیقی ​​​​محله بزرگ (ALNS) برای کمک به یادگیری تقویتی استفاده می‌کنیم که به کاهش اندازه اقدامات و حالت‌ها کمک می‌کند و در نتیجه فرآیند آموزش را تسریع می‌کند. به این ترتیب، یک الگوریتم بهینه‌سازی (ALNS) که دانش دامنه برای حمل و نقل بار همزمان را دارد و یک تکنیک یادگیری ماشین (RL) برای رویدادهای غیرمنتظره برای مدیریت برنامه‌ریزی مجدد حمل و نقل همزمان تحت عدم قطعیت زمان سرویس ادغام می‌شوند. در حالی که روش‌های پیشنهادی در این مطالعه پتانسیل کاربرد در حمل و نقل مسافر را دارند، این مطالعه بر حمل و نقل بار تمرکز دارد.

به دلیل رویدادهای غیرمنتظره، مانند ازدحام، آب و هوای بد و نقص تجهیزات، در ترمینال‌ها تأخیر وجود دارد و شرکت‌های حمل و نقل باید در صورت بروز چنین تأخیرهایی اقدامات مناسبی را انجام دهند. مشکل این است که یک شرکت حمل و نقل معمولاً نمی‌داند یک رویداد غیرمنتظره چقدر طول خواهد کشید. بنابراین، یک رویکرد یادگیری تقویتی با کمک مدل برای یافتن اقدامات مناسب با یادگیری از تجربیات تاریخی همه وسایل نقلیه در شبکه حمل و نقل پیشنهاد شده است. یادگیری تقویتی پیشنهادی از قبل هیچ اطلاعات حمل و نقلی ارائه نمی‌دهد. این یادگیری از هیچ چیز جز ورودی وضعیت، پاداش و اقدامات انجام شده – دقیقاً همانطور که یک شرکت حمل و نقل در عمل انجام می‌دهد – استفاده نمی‌کند. هنگامی که یادگیری تقویتی اجرا نمی‌شود، درخواست‌های و به ترتیب برای حمل و نقل از ترمینال‌های A و C به ترمینال‌های E و G برنامه‌ریزی می‌شوند. با این حال، رویدادهای غیرمنتظره در ترمینال‌های A، B، C و D منجر به عدم قطعیت زمان سرویس می‌شوند و هر دو درخواست با تأخیر می‌رسند. هنگامی که یادگیری تقویتی اجرا می‌شود، درخواست‌های جدید و باید با همان مبدا و مقصد و حمل شوند. یادگیری تقویتی حالت‌ها و مسیرها را بر اساس تجربه خود با درخواست‌های و تنظیم می‌کند. ما اثربخشی رویکرد خود را از طریق مجموعه‌ای از آزمایش‌های شبیه‌سازی نشان می‌دهیم و نشان می‌دهیم که این رویکرد می‌تواند به طور قابل توجهی کارایی برنامه‌ریزی مجدد حمل و نقل همزمان را در مقایسه با روش‌های سنتی غیر یادگیری بهبود بخشد.

سهم اصلی این مقاله به شرح زیر خلاصه می‌شود: (الف) ما یک مسئله برنامه‌ریزی مجدد حمل و نقل همزمان را تحت عدم قطعیت زمان سرویس معرفی می‌کنیم؛ (ب) ما یک چارچوب برنامه‌ریزی مجدد حمل و نقل همزمان را پیشنهاد می‌کنیم که می‌تواند استراتژی‌های مختلف را در خود جای دهد؛ (ج) تحت چارچوب برنامه‌ریزی مجدد، ما یک رویکرد یادگیری تقویتی مبتنی بر مدل را برای مدیریت عدم قطعیت زمان سرویس به صورت آنلاین توسعه می‌دهیم؛ (د) ما عملکرد رویکرد پیشنهادی را تحت سناریوهای مختلف با استفاده از یک شبکه حمل و نقل واقع‌گرایانه، از جمله سناریوهایی با اختلال و قطعی، سناریوهایی با انواع مختلف رویدادها و سناریوهایی با سطوح شدت کامل و ناقص، ارزیابی می‌کنیم.(منبع).