Chuhao Chen، Peter Wonka، Chaoyang Wang، Chen Wang و 3 نفر دیگر
Interactive control for video generation is moving from coarse prompts toward fine-grained, physically meaningful manipulation of dynamic scenes. Yet existing controllable methods either require the full control schedule…
Thanapat Trachu، Samuele Cornell، William Chen، Shinji Watanabe
کدکهای صوتی عصبی، از اجزای کلیدی در مدلسازی زبان گفتار هستند. با این حال، نرخ فریم بالای آنها منجر به افزایش طول دنبالهها و هزینه محاسباتی میشود. کدکهای نرخ فریم پویا این مشکل را از طریق یک مرحله فشردهسازی مؤثر کا…
Keertana Chidambaram، Andrew Ilyas، Vasilis Syrgkanis
نظارت بر زنجیرهی تفکر (CoT) یک استراتژی ایمنی است که در آن، استدلال یک مدل زبانی بزرگ را به عنوان یک «عامل» در نظر میگیرند و توسط یک «نظارتگر» (اغلب یک مدل زبانی دیگر) بررسی میکنند تا نشانههای برنامهریزی ناامن، فریب…
Counterfactual regret minimization (CFR) is one of the few large numerical workloads that still runs faster on CPUs than on GPUs. Each iteration sweeps a game tree with up to billions of states in millions of small, inte…
تعمیمپذیری تحت جابجایی توزیع همچنان چالشی اساسی در یادگیری ماشین مدرن است؛ با این حال، نظریه محدودیتهای یادگیری موجود تنها در چارچوبهای محدود و ایدهآفرینیشده معتبر است و از دادههای نمونه قابل برآورد نیست. در این مق…
William Zhou، Mayukha Siripuram، Xiao Yan، Ziqi Liu و 1 نفر دیگر
Camera traps often run in the field on edge hardware with limited or no connectivity, making small, locally-deployable vision-language models (VLMs) -- not frontier-scale ones -- the practically relevant class to evaluat…
هوش مصنوعی مولد، شیوهی رساندن شرکتها به مشتریان را تغییر میدهد؛ با این حال، دادههای بازاریابی استاندارد، میزان دیدهشدن نام شرکت و توجه کاربران به آن را در پاسخهای تولیدشده ثبت نمیکنند. ما برای تخمین اثرات علّی، مد…
هوش مصنوعی عاملی در حال گذار از اجرای وظایف محدود به سوی سیستمهایی است که حالتهای مهم را حفظ میکنند، به کار خود ادامه میدهند و در سراسر مرزهای وظایف تطبیق مییابند. این تغییر، چالشی درونی برای کنترلکننده ایجاد میکن…
Yanzhe Chen، Zechen Bai، Zhijun Cao، Wenzheng Zeng و 6 نفر دیگر
مدلهای پایهٔ بیناییـزبان (VLMs) دانش گستردهای درباره جهان از خود نشان میدهند؛ بااینحال، تبدیل این دانش به کنترل روبوت همچنان چالشی دشوار است. ما Show-Harness را معرفی میکنیم؛ نمونهای از Harness جسمانی (Embodied H…