arXiv:2609.25001ترجمه شده

GameHorizon Suite: داده و ارزیابی چندافقی در گیم‌پلی

Yiran Wang، Xingyilang Yin، Junfu Pu، Guangzhi Wang، Kaifeng Li، Mingyu Ouyang، Huiqiang Sun، Lingen Li، Cheng Cheng، Wangbo Yu، Honghao Chen، Xiaodong Cun، Chi-Man Pun، Zhiguo Cao، Ying Shan

چکیده

بازی‌های ویدئویی مدرن، بستری مناسب برای آزمایش قابلیت‌های مدل‌های هوش مصنوعی فراهم می‌کنند و توانایی‌های درک بصری، تجزیه دستورالعمل‌ها، برنامه‌ریزی هدف‌مند و کنترل دقیق اقدامات را در افق‌های زمانی مختلف با یکدیگر ترکیب می‌کنند. با این حال، مجموعه‌های داده و معیارهای ارزیابی موجود، یا تنها طیف محدودی از بازی‌ها را پوشش می‌دهند، فاقد دستورالعمل‌های زبانی هستند، یا بر اجراهای آنلاین با واریانس بالا متکی‌اند. برای رفع این چالش‌ها، GameHorizon را معرفی می‌کنیم: مجموعه‌ای یکپارچه از داده و ارزیابی که قابلیت‌های گیم‌پلی را در افق‌های زمانی مختلف برای خانواده‌های متنوع مدل‌ها اندازه‌گیری می‌کند. مجموعه GameHorizon از سه جزء تشکیل شده است. نخست، GameHorizon-Annotator یک خط لوله مقیاس‌پذیر و خودکار برای حاشیه‌نویسی دستورالعمل‌های چندافقی است. دوم، با استفاده از این خط لوله، GameHorizon-Data را ایجاد کرده‌ایم؛ نخستین مجموعه داده مقیاس‌بزرگ از گیم‌پلی بازی‌های AAA که ویدئوها، اقدامات بازیکن و دستورالعمل‌های چندافقی در آن از نظر زمانی هم‌تراز شده‌اند. این مجموعه شامل ۵٬۰۰۰ ساعت ضبط از ۲۱ بازی است که توسط ۱۰۰ بازیکن انسانی خبره جمع‌آوری شده است. سوم، GameHorizon-Bench را با آزمایش‌های تکرارپذیر برون‌خط و آنلاین گام‌به‌گام ساخته‌ایم. مسیر برون‌خط، ارزیابی تکرارپذیر را با استفاده از هزاران پرسش استاندارد، سازمان‌یافته در سه وظیفه اصلی و مجموعه‌ای از گونه‌های تشخیصی، امکان‌پذیر می‌کند؛ در حالی که مسیر آنلاین بررسی می‌کند که آیا امتیازهای برون‌خط بازتاب‌دهنده قابلیت‌های واقعی گیم‌پلی هستند یا خیر، و شکست‌ها را به گام‌های خاصی در گیم‌پلی بلندمدت نسبت می‌دهد. بر اساس مجموعه GameHorizon، ما ۴۷ مدل را از طریق بیش از یک میلیون فراخوانی مدل ارزیابی کرده‌ایم که سلسله‌مراتبی معنادار از دشواری وظایف و تفاوت‌های آشکار در قابلیت‌های مدل‌ها را آشکار می‌کند. کار ما می‌تواند معیاری استاندارد برای ارزیابی قابلیت‌های گیم‌پلی در افق‌های زمانی مختلف و در میان خانواده‌های مدل‌ها فراهم کند. ما مجموعه داده، حاشیه‌نویس و معیار سنجش خود را برای تسهیل تحقیقات آینده منتشر خواهیم کرد.

متن کامل

Computer Science > Computer Vision and Pattern Recognition arXiv:2609.25001v1 (cs) [Submitted on 21 سپتامبر 2026] Title: GameHorizon Suite: داده و ارزیابی چندافق در بازی Authors: Yiran Wang, Xingyilang Yin, Junfu Pu, Guangzhi Wang, Kaifeng Li, Mingyu Ouyang, Huiqiang Sun, Lingen Li, Cheng Cheng, Wangbo Yu, Honghao Chen, Xiaodong Cun, Chi-Man Pun, Zhiguo Cao, Ying Shan View a PDF of the paper titled GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay, by Yiran Wang and 14 other authors View PDF HTML (experimental) Abstract: بازی‌های ویدیویی مدرن یک بستر قابل اندازه‌گیری برای مدل‌های هوش مصنوعی فراهم می‌کنند، که در آن درک بصری، تجزیه دستورالعمل‌ها، برنامه‌ریزی هدف و کنترل دقیق عمل در افق‌های زمانی مختلف ترکیب می‌شود. با این حال، مجموعه داده‌ها و بِنچ‌مارک‌های موجود یا محدوده‌ای محدود از بازی‌ها را پوشش می‌دهند، یا دستورالعمل‌های زبانی ندارند، یا به Rollout‌های آنلاین با واریانس بالا متکی هستند. برای رفع این چالش‌ها، ما GameHorizon Suite را معرفی می‌کنیم، یک مجموعه داده و ارزیابی یکپارچه که عملکرد بازی را در افق‌های مختلف برای خانواده‌های مختلف مدل‌ها اندازه‌گیری می‌کند. GameHorizon Suite از سه مؤلفه تشکیل شده است. اول، GameHorizon-Annotator یک خط لوله انوتیشن مقیاس‌پذیر و خودکار برای دستورالعمل‌های چندافق است. دوم، با استفاده از این خط لوله، ما GameHorizon-Data را ساخته‌ایم، اولین مجموعه داده در مقیاس بزرگ از بازی‌های AAA با ویدیوها، اقدامات بازیکن و دستورالعمل‌های چندافق هم‌زمان، شامل ۵٬۰۰۰ ساعت ضبط از ۲۱ بازی که توسط ۱۰۰ بازیکن انسانی متخصص گردآوری شده است. سوم، ما GameHorizon-Bench را با آزمون‌های آفلاین و آنلاین گام‌به‌گام قابل تکرار ساخته‌ایم. مسیر آفلاین امکان ارزیابی قابل تکرار با استفاده از هزاران سؤال استاندارد که به سه وظیفه اصلی و نسخه‌های تشخیصی تقسیم می‌شوند، فراهم می‌کند، در حالی که مسیر آنلاین بررسی می‌کند که آیا نتایج آفلاین توانایی‌های واقعی بازی را منعکس می‌کنند و شکست‌ها را به مراحل خاص در بازی‌های افق طولانی مکان‌یابی می‌کند. بر پایهٔ GameHorizon Suite، ما ۴۷ مدل را از طریق بیش از یک میلیون فراخوانی مدل ارزیابی کردیم، که یک سلسله مراتب معنادار از دشواری وظیفه و تفاوت‌های واضح در توانایی‌های مدل‌ها را نشان داد. کار ما می‌تواند یک معیار استاندارد برای ارزیابی توانایی‌های بازی در افق‌های مختلف و خانواده‌های مدل‌ها فراهم کند. ما مجموعه داده، انوتیتور و بِنچ‌مارک خود را برای تسهیل تحقیقات آینده منتشر خواهیم کرد. Comments: موضوعات: بینایی کامپیوتر و تشخیص الگو (cs.CV); هوش مصنوعی (cs.AI) استناد به: arXiv:2609.25001 [cs.CV] (یا arXiv:2609.25001v1 [cs.CV