شماره ركورد
26098
شماره راهنما
COM2 725
عنوان
مدل سازي ارتباط موثر در سيستم هاي چند عاملياز طريق رويكردهاي مبتني بر گراف
مقطع تحصيلي
كارشناسي ارشد
رشته تحصيلي
مهندسي كامپيوتر - هوش مصنوعي و رباتيكز
دانشكده
مهندسي كامپيوتر
تاريخ دفاع
1404/07/20
صفحه شمار
97 ص .
استاد راهنما
حسين كارشناس
كليدواژه فارسي
يادگيري تقويتي چندعاملي , شبكه هاي عصبي گرافي , مدل سازي ارتباطات چند عاملي , يادگيري تقويتي مقياس پذير
چكيده فارسي
يادگيري تقويتي چندعامله به عنوان يكي از رويكردهاي پيشرو براي حل مسائل پيچيده و توزيع شده
در هوش مصنوعي شناخته مي شود. با اين حال، ايجاد هماهنگي كارآمد ميان تعداد زيادي از عامل هاي
همه- » هوشمند، همچنان با چالش هاي اساسي روبروست. مدل هاي متداول فعلي اغلب بر پايه ارتباطات
استوار هستند؛ رويكردي كه نه تنها بار محاسباتي سنگيني را تحميل مي كند، بلكه با انتشار « با-همه
اطلاعات غيرضروري و نامرتبط ميان عامل ها، منجر به كاهشتمركز و سردرگمي مدل در فرآيند يادگيري
مي شود. از سوي ديگر، روش هايي كه وظيفه كشف ساختار ارتباطي ميان عامل ها را تماماً به شبكه هاي
عصبي مي سپارند، در محيط هاي پيچيده عملكردي ناپايدار داشته و خروجي هاي نويزي توليد مي كنند.
علاوه بر اين، ناديده گرفتن وابستگي هاي علي ميان تصميمات عامل ها و اصرار بر تصميم گيري هم زمان،
مانع از شكل گيري استراتژي هاي هماهنگ و دقيق مي گردد.
ترانسفورمر اولويت بندي شده » اين پژوهش با هدف رفع اين محدوديت ها، معماري نويني تحت عنوان
را معرفي مي كند. نوآوري اصلي اين مدل، تلفيق ساختاردهي هوشمند به ارتباطات « مبتني بر فاكتور
و تصميم گيري ترتيبي پويا است. در اين معماري، تعاملات ميان عامل ها در قالب يك گراف دوجزئي
مدل سازي مي شود كه در آن، عامل ها در گروه هايي هم پوشان سازماندهي شده و توسط گره هاي واسطي
نمايندگي مي شوند. اين ساختار باعث مي شود كه جريان اطلاعات به جاي پخش شدن « فاكتور » به نام
در كل شبكه، تنها از مجراي اين فاكتورها عبور كرده و ضمن كاهش پيچيدگي، از شكل گيري ارتباطات
زائد جلوگيري شود.
در لايه تصميم گيري، اين پژوهش با عبور از تصميم گيري هم زمان، از يك مكانيزم نوين توليد كنش
ترتيبي بهره مي برد. اين مكانيزم با استفاده از نمونه برداري احتمالي و تخصيصامتياز اعتبار به مشاهدات
هر عامل، در هر لحظه مشخص مي كند كه كدام عامل داراي اطلاعات حياتي تري است و بايد در اولويت
تصميم گيري قرار گيرد. بدين ترتيب، ساير عامل ها مي توانند با آگاهي از تصميمات عامل هاي كليدي،
كنش هاي خود را تنظيم كنند.
كارايي روش پيشنهادي در محيط هاي شبيه سازي فوتبال و نبردهاي استراتژيك كه نيازمند سطح بالايي
از همكاري هستند، مورد ارزيابي دقيق قرار گرفت. نتايج تجربي نشان مي دهد كه مدل پيشنهادي
با دستيابي به نرخ پيروزي 92 درصد در سناريوهاي دشوار و بهبود چشمگير امتياز نهايي، عملكردي
به مراتب برتر و پايدارتر نسبت به الگوريتم هاي پيشرفته پيشين از خود نشان داده است. اين يافته ها
اثبات مي كند كه تركيب يك ساختار ارتباطي منسجم و كنترل شده با فرآيند تصميم گيري اولويت محور،
راهكاري كليدي براي غلبه بر چالش هاي مقياس پذيري و نويز در سيستم هاي چندعامله است.
كليدواژه لاتين
Multi-Agent Reinforcement Learning , Graph Neural Networks , Multi agent communication modeling , Scalable Reinforcement Learning
عنوان لاتين
Effective Communication modeling in Multi-Agent Systems via Graph-Based Approaches
گروه آموزشي
مهندسي هوش مصنوعي
چكيده لاتين
Multi-Agent Reinforcement Learning (MARL) is recognized as a prominent approach
for solving complex and distributed problems. Nevertheless, achieving efficient
coordination among a large number of intelligent agents remains a fundamental
challenge. Current models often rely on ”all-to-all” communication paradigms;
an approach that not only imposes a heavy computational burden but also leads
to the propagation of unnecessary and irrelevant information, resulting in model
confusion during the learning process. Conversely, methods that delegate the task
of discovering communication structures entirely to neural networks tend to exhibit
unstable performance and generate noisy outputs in complex environments. Furthermore,
disregarding causal dependencies among agent decisions and persisting with simultaneous
decision-making hinders the formation of precise, coordinated strategies. To address
these limitations, this research introduces a novel architecture titled ”Factor Prioritized
Transformer” (FPT). The core innovation of this model lies in integrating intelligent
communication structuring with dynamic sequential decision-making. In this architecture,
agent interactions are modeled within a bipartite graph framework, where agents
are organized into overlapping groups represented by intermediary nodes called
”factors.” This structure ensures that information flow is channeled exclusively through
these factors, thereby reducing complexity and preventing the formation of redundant
connections. At the decision-making layer, this study moves beyond the simultaneous
paradigm by employing a novel sequential action generation mechanism. Utilizing
probabilistic sampling and assigning credit scores to each agent’s observations, this
mechanism dynamically determines which agent possesses critical information at
any given moment and should be prioritized in decision-making. Consequently,
subsequent agents can adjust their actions with awareness of the decisions made by
key agents. The efficacy of the proposed method was rigorously evaluated in Google
Research Football (GRF) and StarCraft II (SMAC) simulation environments, which
require high levels of cooperation. Empirical results demonstrate that the proposed
model, achieving a 92% win rate in challenging scenarios and significant improvements
in final scores, exhibits far superior and more stable performance compared to stateof-
the-art algorithms. These findings substantiate that combining a coherent, controlled
communication structure with a priority-based decision-making process is a key
solution for overcoming scalability and noise challenges in multi-agent systems.
تعداد فصل ها
5
فهرست مطالب pdf
167423
نويسنده