Joseph Lee، Yidi Huang، Dokyoon Kim، Shu Yang و 1 نفر دیگر
تکانههای همچنان درک ما از نحوه بهدستآوردن دانش توسط مدلهای زبانی بزرگ (LLMs) در پیشآموزش دارند. ما معتقدیم که دیدگاههای کمکی (بازنگریهای دانش) بهصورت علّی برای یادگیری مفید هستند و این موضوع را از طریق طراحی آزما…
Rafal Urbaniak، Sam Witty، Daniel Waxman، Andy Zane و 6 نفر دیگر
بیان دلایل وقوع یک نتیجهٔ خاص و تعیین ورودیهایی که مسئول یا مورد قدردانی آن هستند، در قلب تحلیلهای فلسفی، علمی و سیاستگذاری قرار دارد. ابزارهای موجود را میتوان به دو دسته تقسیم کرد. نظریهٔ علیت واقعی (AC) تصمیمگیری…
Davide Paglieri، Logan Cross، Tim Genewein، Joel Z. Leibo و 2 نفر دیگر
Multi-agent AI science ecosystems rely on agents possessing tools that allow them to communicate, coordinate, and build on each other's work. Yet this shared infrastructure can also introduce vulnerabilities by creating…
Kelvin Li، Dhruv Pendharkar، Anish Pahilajani، Chuyi Shang و 5 نفر دیگر
وبسایتهای اخیر برای انتخاب عمل در زمان تست با نمونهبرداری از اقدامات نامزد، پیشبینی وضعیتهای وب حاصل و رتبهبندی آنها از طریق مدلهای رتبهبند یا مدل پاداش فرآیندی (PRM) استفاده میکنند. این مدلهای جهانی معمولاً ا…
رباتهای خودکاری که با یادگیری عمیق تغذیه میشوند، با چالش بنیادی قابلیت بازبینی مواجهاند: هنگام وقوع حوادث، محققان قادر به بازسازی دلایل تصمیمات خاص اتخاذشده توسط سیستم نیستند. این مقاله چارچوب تریاسیک (TRACE — معماری…
Aleksander Ficek، Sean Narenthiran، Mehrzad Samadi، Somshubra Majumdar و 1 نفر دیگر
Competitive programming has become a key test of large language model reasoning, with international competitions such as IOI and ICPC representing its most challenging settings. We present an end-to-end specialization pi…
Hao Zhou، Mandar Kulkarni، Hao Chen، Yan Xin و 2 نفر دیگر
تحلیل علت ریشهای (RCA) یک وظیفهٔ حیاتی در عملیات شبکههای مخابراتی است، اما شناسایی افتهای عملکردی در شبکههای مدرن ۵G و شبکههای نوظهور ۶G بهدلیل وابستگیهای پیچیدهٔ بینلایهای همچنان چالشبرانگیز باقی مانده است. مد…
به مدت بیش از ۲۰ سال، نمونه مرجع Model-RB (frb100-40) یک چالش باز باقی مانده بود؛ از سال ۲۰۱۴، رکورد عمومی آن ۹۹ از ۱۰۰ متغیر بوده است. ما یک مجموعه مستقل ۱۰۰-رأسی قابل بررسی مستقیم برای گراف ۴٬۰۰۰-رأسی آن ارائه میدهیم.…