Anqi Li، Yuxin Chen، Zhaobo Li، Zhuo Cao و 3 نفر دیگر
ما به مسئلهی حرکت روبات انسانشبیه در محیطهای داخلی پرزرق و برق میپردازیم. برخلاف روشهای رایج که مسیریابی را بهعنوان یک مسألهی برنامهریزی مسیر دوبعدی مدل میکنند، حرکت انسانشبیه در فضاهای پرزرق و برق نیازمند تنظی…
Yuxing Lu، Yicheng Chen، Shanchan Wu، Sercan Ö. Arık
مدلهای زبانی بزرگ (LLM) بهطور فزاینده بهعنوان عوامل (agents) مستقر میشوند که در افقهای طولانی برنامهریزی میکنند و از طریق ابزارهای خارجی عمل میکنند.
اکثر عوامل، از طریق تولید بیمحدود، بر تاریخچهٔ تجمعی اقدامات ت…
Tobias Susetzky، Raphael Rehms، Dmitrii Seletkov، Özgün Turgut و 4 نفر دیگر
دیجیتالسازی مراقبتهای بهداشتی، رکوردهای بیمار گسترده، طولانیمدت و چندگانه را در طول عمر تولید کرده است، اما بهکارگیری کامل این دادهها برای نمایش و پیشبینی مسیرهای وضعیت بیمار همچنان یک چالش مهم است. مدلهای هوش مصن…
Zhou Yu، Bin Bi، Shiva Kumar Pentyala، Shubham Mehrotra و 7 نفر دیگر
تلههای عامل (پرامپت سیستمی، مجموعه ابزار، قلابهای اجرایی و ساختار حمایتی مدیریت زمینه در اطراف یک مدل) نقش تعیینکنندهای در موفقیت وظایف عاملی دارند. تکامل خودکار تله میتواند مدلهای کوچکتر را در انجام وظایف تخصصی ح…
Visual encoders construct a representation of the image input for Vision-Language models. How much conceptual, as opposed to immediately visible, information does this representation contain? We use canonical color as a…
Yankai Fu، Ning Chen، Junkai Zhao، Heng Zhang و 4 نفر دیگر
Dexterous manipulation involves contact-rich and fine-grained interactions with the physical world, posing significant challenges for existing vision-language-action (VLA) models due to severe visual occlusions and compl…
Boyu Yang، Jiazheng Sun، Zilong Lu، Zhi Qiu و 2 نفر دیگر
Long horizon Large Language Model (LLM) agents rely on external memory systems to preserve user preferences and task knowledge across extended interactions. Conventional retrieval mechanisms optimize semantic compatibili…