arXiv:2609.22068ترجمه شده

CodeMidas: بزرگ‌نمایی محیط‌های یادگیری تقویتی کدنویسی آژانتیک از خود کد

Bowen Ye، Lei Li، Shicheng Li، Zihao Yue، Linghao Zhang، Hanglong Lv، Yuanxin Liu، Wenhan Ma، Hao Tian، Rang Li، Jinhao Dong، Yikai Zhao، Xiangwei Deng، Hailin Zhang، Liang Zhao، Qi Liu، Lingpeng Kong، Tong Yang، Fuli Luo

چکیده

User Safety: safe

متن کامل

**علوم کامپیوتر > هوش مصنوعی arXiv:2609.22068v1 (cs) [ارائه شده در ۱۸ سپتامبر ۲۰۲۶]** **عنوان:** CodeMidas: مقیاس‌پذیری محیط‌های RL کدنویسی عامل‌گرا از روی خود کد **نویسندگان:** Bowen Ye, Lei Li, Shicheng Li, Zihao Yue, Linghao Zhang, Hanglong Lv, Yuanxin Liu, Wenhan Ma, Hao Tian, Rang Li, Jinhao Dong, Yikai Zhao, Xiangwei Deng, Hailin Zhang, Liang Zhao, Qi Liu, Lingpeng Kong, Tong Yang, Fuli Luo **مشاهده PDF مقاله با عنوان «CodeMidas: Scaling Agentic Coding RL Environments from Code Itself»، توسط Bowen Ye و هجده نویسندهٔ دیگر** **مشاهده PDF | HTML (تجربی)** **چکیده:** آموزش عامل‌های کدنویسی قادر از طریق یادگیری تقویتی (RL) مستلزم داشتن وظایف متنوع و تأییدکنندهٔ قابل اعتماد است. مخازن کد منبع‌باز حاوی این‌گونه وظایف غنی هستند، اما روش‌های موجود معمولاً به مصنوعات توسعه مانند Issues و Commits متکی هستند و طیف قابل استخراج وظایف را محدود می‌سازند. برای مقیاس‌پذیری بهتر محیط‌های RL، ما CodeMidas را معرفی می‌کنیم؛ یک لوله‌چین عامل‌گرا که عملکردهای پیاده‌سازی‌شده موجود در مخازن کد را به محیط‌های RL قابل اجرا تبدیل می‌کند، با استفاده از کد منبع به‌عنوان تنها ورودی خاص وظیفه. در CodeMidas، هر مرحله از ساخت محیط به یک عامل مخصص می‌شود: این عوامل ابتدا عملکردهای پیاده‌سازی‌شده را کاوش می‌کنند تا مشخصات رفتاری استخراج کنند؛ سپس تست‌هایی بر پایهٔ اجرای کد اصلی می‌سازند؛ و در نهایت، کاندیدهای وظیفه از طریق بررسی‌های اجرا و رول‌اوت‌های (rollouts) تکراری اعتبارسنجی و فیلتر می‌شوند. مجموعه داده حاصل شامل ۵٬۵۴۵ وظیفه آموزشی از ۳٬۱۸۵ مخزن کد منبع‌باز است که ۲۳ زبان برنامه‌نویسی و ۱۵ حوزه فنی را پوشش می‌دهد. آموزش مدل MiMo‑V2.5 بر این وظایف با الگوریتم GRPO، عملکرد را در پنج معیار متنوع بهبود می‌بخشد؛ شامل تعمیر مسئله (DeepSWE + ۱۱٫۷٪)، ساخت برنامه کامل (ProgramBench + ۱۷٪)، و کار ترمینال (Terminal‑Bench v2.1 + ۸٫۵٪). تست‌های ابلیشن نشان می‌دهند که افزایش تعداد وظایف آموزشی با کیفیت بالا، عملکرد را ارتقا می‌بخشد. تحلیل مسیرها (trajectory analysis) می‑گواهد که عامل آموزش‌دیده با RL، رفتارهای بهتری از جمله افزایش کاوش مخزن کد و خود‑تأیید (self‑verification) متنوع‌تر نشان می‌دهد. این نتایج تأیید می‌کنند که کد منبع می‌تواند به‌عنوان پایهٔ مقیاس‌پذیر برای ساخت محیط‌های RL عمل کند و عامل‌های کدنویسی را در طیف وسیعی از وظایف نرم‌افزاری بهبود بخشد. **موضوعات:** هوش مصنوعی (cs.AI) **استشهاد به صورت:** arXiv:2609.22068 [cs.AI] (یا arXiv:2609.22068v1 [cs.AI] برای این نسخه) https://doi.org/10.48550/arXiv.2609.22068 **تمرکز برای یادگیری بیشتر** DOI صادرشده توسط arXiv از طریق DataCite (در انتظار ثبت) **تاریخچه ارائه** از: Rang Li [مشاهده ایمیل] [v1] جمعه، ۱۸ سپتامبر ۲۰۲۶ ۱۷:۵۵:۱۷ UTC (۲۳۷ KB) **ابزارهای بیблиوگرافیک** ابزارهای بیibliوگرافیک و استشهاد **کاوشگر بیibliوگرافیک** تغییر وضعیت کاوشگر بیibliوگرافیک (کاوشگر چیست؟) **مقالات مرتبط** تغییر وضعیت مقالات مرتبط (مقالات مرتبط چیست؟) **Litmaps** تغییر وضعیت Litmaps (Litmaps چیست؟) **scite.ai** تغییر وضعیت استشهادهای هوشمند scite (استشهادهای هوشمند چیست؟) **کد، داده، رسانه** کد، داده و رسانه مرتبط با این مقاله **alphaXiv** تغییر وضعیت alphaXiv (alphaXiv چیست؟) **لینک‌ها به کد** تغییر وضعیت یابنده کد CatalyzeX برای مقالات (CatalyzeX چیست؟) yzeX?) DagsHub باز و بسته کردن DagsHub (DagsHub چیست؟) GotitPub باز و بسته کردن Gotit.pub (GotitPub چیست؟) Hugging Face باز و بسته کردن Hugging Face (Hugging Face چیست؟) ScienceCast باز و بسته کردن ScienceCast (ScienceCast چیست؟) نمایش‌ها نمایش‌ها Replicate باز و بسته کردن Replicate (Replicate چیست؟) Spaces باز و بسته کردن Hugging Face Spaces (Spaces چیست؟) Spaces باز و بسته کردن TXYZ.AI (TXYZ.AI چیست؟) مقالات مرتبط سامانه‌های توصیه‌گر و ابزارهای جستجو پیوند به Influence Flower Influence Flower (Influence Flowers چیست؟) باز و بسته کردن توصیه‌گر CORE CORE Recommender (CORE چیست؟) نویسنده محل انتشار مؤسسه موضوع درباره arXivLabs arXivLabs: پروژه‌های آزمایشی با مشارکت‌کنندگان جامعه arXivLabs چارچوبی است که به مشارکت‌کنندگان امکان می‌دهد قابلیت‌های جدید arXiv را توسعه داده و مستقیماً در وب‌سایت ما به اشتراک بگذارند. هم افراد و هم سازمان‌هایی که با arXivLabs همکاری می‌کنند، ارزش‌های ما در زمینه گشودگی، اجتماع‌محوری، تعالی و حریم خصوصی داده‌های کاربران را پذیرفته‌اند. arXiv به این ارزش‌ها متعهد است و فقط با شرکایی همکاری می‌کند که از آن‌ها پیروی می‌کنند. آیا ایده‌ای برای پروژه‌ای دارید که برای جامعه arXiv ارزش افزوده ایجاد کند؟ درباره arXivLabs بیشتر بدانید. کدام‌یک از نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال کردن MathJax (MathJax چیست؟)