• شماره ركورد
    26098
  • شماره راهنما
    COM2 725
  • عنوان

    مدل سازي ارتباط موثر در سيستم هاي چند عاملياز طريق رويكردهاي مبتني بر گراف

  • مقطع تحصيلي
    كارشناسي ارشد
  • رشته تحصيلي
    مهندسي كامپيوتر - هوش مصنوعي و رباتيكز
  • دانشكده
    مهندسي كامپيوتر
  • تاريخ دفاع
    1404/07/20
  • صفحه شمار
    97 ص .
  • استاد راهنما
    حسين كارشناس
  • كليدواژه فارسي
    يادگيري تقويتي چندعاملي , شبكه هاي عصبي گرافي , مدل سازي ارتباطات چند عاملي , يادگيري تقويتي مقياس پذير
  • چكيده فارسي
    يادگيري تقويتي چندعامله به عنوان يكي از رويكردهاي پيشرو براي حل مسائل پيچيده و توزيع شده در هوش مصنوعي شناخته مي شود. با اين حال، ايجاد هماهنگي كارآمد ميان تعداد زيادي از عامل هاي همه- » هوشمند، همچنان با چالش هاي اساسي روبروست. مدل هاي متداول فعلي اغلب بر پايه ارتباطات استوار هستند؛ رويكردي كه نه تنها بار محاسباتي سنگيني را تحميل مي كند، بلكه با انتشار « با-همه اطلاعات غيرضروري و نامرتبط ميان عامل ها، منجر به كاهشتمركز و سردرگمي مدل در فرآيند يادگيري مي شود. از سوي ديگر، روش هايي كه وظيفه كشف ساختار ارتباطي ميان عامل ها را تماماً به شبكه هاي عصبي مي سپارند، در محيط هاي پيچيده عملكردي ناپايدار داشته و خروجي هاي نويزي توليد مي كنند. علاوه بر اين، ناديده گرفتن وابستگي هاي علي ميان تصميمات عامل ها و اصرار بر تصميم گيري هم زمان، مانع از شكل گيري استراتژي هاي هماهنگ و دقيق مي گردد. ترانسفورمر اولويت بندي شده » اين پژوهش با هدف رفع اين محدوديت ها، معماري نويني تحت عنوان را معرفي مي كند. نوآوري اصلي اين مدل، تلفيق ساختاردهي هوشمند به ارتباطات « مبتني بر فاكتور و تصميم گيري ترتيبي پويا است. در اين معماري، تعاملات ميان عامل ها در قالب يك گراف دوجزئي مدل سازي مي شود كه در آن، عامل ها در گروه هايي هم پوشان سازماندهي شده و توسط گره هاي واسطي نمايندگي مي شوند. اين ساختار باعث مي شود كه جريان اطلاعات به جاي پخش شدن « فاكتور » به نام در كل شبكه، تنها از مجراي اين فاكتورها عبور كرده و ضمن كاهش پيچيدگي، از شكل گيري ارتباطات زائد جلوگيري شود. در لايه تصميم گيري، اين پژوهش با عبور از تصميم گيري هم زمان، از يك مكانيزم نوين توليد كنش ترتيبي بهره مي برد. اين مكانيزم با استفاده از نمونه برداري احتمالي و تخصيصامتياز اعتبار به مشاهدات هر عامل، در هر لحظه مشخص مي كند كه كدام عامل داراي اطلاعات حياتي تري است و بايد در اولويت تصميم گيري قرار گيرد. بدين ترتيب، ساير عامل ها مي توانند با آگاهي از تصميمات عامل هاي كليدي، كنش هاي خود را تنظيم كنند. كارايي روش پيشنهادي در محيط هاي شبيه سازي فوتبال و نبردهاي استراتژيك كه نيازمند سطح بالايي از همكاري هستند، مورد ارزيابي دقيق قرار گرفت. نتايج تجربي نشان مي دهد كه مدل پيشنهادي با دستيابي به نرخ پيروزي 92 درصد در سناريوهاي دشوار و بهبود چشمگير امتياز نهايي، عملكردي به مراتب برتر و پايدارتر نسبت به الگوريتم هاي پيشرفته پيشين از خود نشان داده است. اين يافته ها اثبات مي كند كه تركيب يك ساختار ارتباطي منسجم و كنترل شده با فرآيند تصميم گيري اولويت محور، راهكاري كليدي براي غلبه بر چالش هاي مقياس پذيري و نويز در سيستم هاي چندعامله است.
  • كليدواژه لاتين
    Multi-Agent Reinforcement Learning , Graph Neural Networks , Multi agent communication modeling , Scalable Reinforcement Learning
  • عنوان لاتين
    Effective Communication modeling in Multi-Agent Systems via Graph-Based Approaches
  • گروه آموزشي
    مهندسي هوش مصنوعي
  • چكيده لاتين
    Multi-Agent Reinforcement Learning (MARL) is recognized as a prominent approach for solving complex an‎d distributed problems. Nevertheless, achieving efficient coordination among a large number of intelligent agents remains a fundamental challenge. Current models often rely on ”all-to-all” communication paradigms; an approach that not only imposes a heavy computational burden but also leads to the propagation of unnecessary an‎d irrelevant information, resulting in model confusion during the learning process. Conversely, methods that delegate the task of discovering communication structures entirely to neural networks tend to exhibit unstable performance an‎d generate noisy outputs in complex environments. Furthermore, disregarding causal dependencies among agent decisions an‎d persisting with simultaneous decision-making hinders the formation of precise, coordinated strategies. To address these limitations, this research introduces a novel architecture titled ”Factor Prioritized Transformer” (FPT). The core innovation of this model lies in integrating intelligent communication structuring with dynamic sequential decision-making. In this architecture, agent interactions are modeled within a bipartite graph framework, where agents are organized into overlapping groups represented by intermediary nodes called ”factors.” This structure ensures that information flow is channeled exclusively through these factors, thereby reducing complexity an‎d preventing the formation of redundant connections. At the decision-making layer, this study moves beyond the simultaneous paradigm by employing a novel sequential action generation mechanism. Utilizing probabilistic sampling an‎d assigning credit scores to each agent’s observations, this mechanism dynamically determines which agent possesses critical information at any given moment an‎d should be prioritized in decision-making. Consequently, subsequent agents can adjust their actions with awareness of the decisions made by key agents. The efficacy of the proposed method was rigorously eva‎luated in Google Research Football (GRF) an‎d StarCraft II (SMAC) simulation environments, which require high levels of cooperation. Empirical results demonstrate that the proposed model, achieving a 92% win rate in challenging scenarios an‎d significant improvements in final scores, exhibits far superior an‎d more stable performance compared to stateof- the-art algorithms. These findings substantiate that combining a coherent, controlled communication structure with a priority-based decision-making process is a key solution for overcoming scalability an‎d noise challenges in multi-agent systems.
  • تعداد فصل ها
    5
  • فهرست مطالب pdf
    167423
  • نويسنده

    نيكبخت، عرشيا