Group-based reinforcement learning methods such as GRPO for large language models avoid training a critic by sampling multiple responses for each prompt. A reliable critic could instead estimate token-level advantages fr…
ما یک روش نوتنگریان مستقیم تسریعشده و بدون هسسی جدید را برای بهینهسازی توابع خمیده با هسسی پیوسته لپسچیتز توسعه میدهیم. این الگوریتم تنها از متغیرهای اولیه استفاده میکند و در هر تکرار تنها یک حل خطی انجام میدهد. با…
Elaine Lau، Thanuka Udumulla، Lee Izhaki-Tavor، Francisco Guzmán و 2 نفر دیگر
در حوزههای حرفهای علوم زندگی، دانشمندان معمولاً از تفسیر آثار بصری مانند ژلهای بلوتها، تصاویر میکروسکوپی، نقشههای پلازمید، نمودارهای سیتومتری جریان، ساختارهای مولکولی و غیره استفاده میکنند تا تصمیمگیریهای پژوهشی…
1. بهبود جریان و خوانایی متن
2. ساختار جملات فارسی طبیعیتر
3. تطابق در اصطلاحات و اصطلاحات فنی
4. اصلاح اشتباهات ترجمه
5. حفظ اصطلاحات و فرمولهای فنی بدون تغییر
6. حفظ ساختار بخشها بدون تغییر
7. حفظ منابع…
Vladimir Bataev، Lilit Grigoryan، Andrei Andrusenko، Nikolay Karpov و 2 نفر دیگر
زمینهسازی برای سیستمهای تشخیص گفتار خودکار (ASR) در محیطهای عملیاتی، اهمیتی حیاتی دارد؛ بهگونهای که جملاتِ ارائهشده توسط کاربر باید تحت محدودیتهای زمانی سخت، با دقت بالا تشخیص داده شوند. اگرچه بسیاری از روشهای تأ…
Shiao Xie، Siyu Chen، Jianwei Lv، Bo Yuan و 2 نفر دیگر
Personalized interpretation of medical reports has emerged as an increasingly important need among patients. Addressing this need requires both evidence-grounded medical factuality and context-dependent patient communica…
Narges Ahmadi، Yubo Jiao، Jônatas Augusto Manzolli، Jiangbo Yu و 1 نفر دیگر
تحقیقات در زمینه رفتار مسافران، دادههای دیجیتال را به طور متمرکزتری با مدلسازی پیشبینی ترکیب میکنند، اما این مراحل معمولاً به طور جداگانه توسعه و ارزیابی میشوند. این مطالعه یک فرآیند سهمرحلهای را پیشنهاد میکند که…
Yucheng Jiang، Zora Zhiruo Wang، Ruishi Chen، Diyi Yang
Naturalistic computer-use traces, passively recorded screenshots and mouse or keyboard actions, are a valuable resource for deriving symbolic, auditable, and reusable models of how everyday work is done. Such models matt…
Yizhe Chi، Wenyi Li، Deyao Hong، Xiaoqiu Wang و 6 نفر دیگر
Recursive self-improvement (RSI) asks whether an AI system can improve the process that produces AI systems, so that the next system inherits the improvement. That process is the training algorithm: a better objective or…