Breaking Barriers: Do Reinforcement Post Training Gains Transfer To Unseen Domains?
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Chuxuan, Zhu, Yuxuan, Kellermann, Antony, Biddulph, Caleb, Waiwitlikhit, Suppakit, Benn, Jason, Kang, Daniel |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Trustless Audits without Revealing Data or Models
di: Waiwitlikhit, Suppakit, et al.
Pubblicazione: (2024)
di: Waiwitlikhit, Suppakit, et al.
Pubblicazione: (2024)
DRAMA: Unifying Data Retrieval and Analysis for Open-Domain Analytic Queries
di: Hu, Chuxuan, et al.
Pubblicazione: (2025)
di: Hu, Chuxuan, et al.
Pubblicazione: (2025)
Breaking the Script Barrier in Multilingual Pre-Trained Language Models with Transliteration-Based Post-Training Alignment
di: Xhelili, Orgest, et al.
Pubblicazione: (2024)
di: Xhelili, Orgest, et al.
Pubblicazione: (2024)
Learning to Generalize Unseen Domains via Multi-Source Meta Learning for Text Classification
di: Hu, Yuxuan, et al.
Pubblicazione: (2024)
di: Hu, Yuxuan, et al.
Pubblicazione: (2024)
SODIUM: From Open Web Data to Queryable Databases
di: Hu, Chuxuan, et al.
Pubblicazione: (2026)
di: Hu, Chuxuan, et al.
Pubblicazione: (2026)
REPRO-Bench: Can Agentic AI Systems Assess the Reproducibility of Social Science Research?
di: Hu, Chuxuan, et al.
Pubblicazione: (2025)
di: Hu, Chuxuan, et al.
Pubblicazione: (2025)
PEO: Improving Bi-Factorial Preference Alignment with Post-Training Policy Extrapolation
di: Liu, Yuxuan
Pubblicazione: (2025)
di: Liu, Yuxuan
Pubblicazione: (2025)
Breaking Language Barriers: Cross-Lingual Continual Pre-Training at Scale
di: Zheng, Wenzhen, et al.
Pubblicazione: (2024)
di: Zheng, Wenzhen, et al.
Pubblicazione: (2024)
Reinforcement Learning for LLM Post-Training: A Survey
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
Emotion Transfer with Enhanced Prototype for Unseen Emotion Recognition in Conversation
di: Peng, Kun, et al.
Pubblicazione: (2025)
di: Peng, Kun, et al.
Pubblicazione: (2025)
LLMs Can Also Do Well! Breaking Barriers in Semantic Role Labeling via Large Language Models
di: Li, Xinxin, et al.
Pubblicazione: (2025)
di: Li, Xinxin, et al.
Pubblicazione: (2025)
Who Watches the Watchmen? Humans Disagree With Translation Metrics on Unseen Domains
di: Schmidt, Finn, et al.
Pubblicazione: (2026)
di: Schmidt, Finn, et al.
Pubblicazione: (2026)
PTPP-Aware Adaptation Scaling Laws: Predicting Domain-Adaptation Performance at Unseen Pre-Training Budgets
di: Goffinet, Etienne, et al.
Pubblicazione: (2025)
di: Goffinet, Etienne, et al.
Pubblicazione: (2025)
Fine-Tuned Machine Translation Metrics Struggle in Unseen Domains
di: Zouhar, Vilém, et al.
Pubblicazione: (2024)
di: Zouhar, Vilém, et al.
Pubblicazione: (2024)
Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale
di: Zhang, Liujie, et al.
Pubblicazione: (2026)
di: Zhang, Liujie, et al.
Pubblicazione: (2026)
Breaking the Capability Ceiling of LLM Post-Training by Reintroducing Markov States
di: Yuan, Yurun, et al.
Pubblicazione: (2026)
di: Yuan, Yurun, et al.
Pubblicazione: (2026)
On Domain-Adaptive Post-Training for Multimodal Large Language Models
di: Cheng, Daixuan, et al.
Pubblicazione: (2024)
di: Cheng, Daixuan, et al.
Pubblicazione: (2024)
MOOSE-Star: Unlocking Tractable Training for Scientific Discovery by Breaking the Complexity Barrier
di: Yang, Zonglin, et al.
Pubblicazione: (2026)
di: Yang, Zonglin, et al.
Pubblicazione: (2026)
Phi-3 Safety Post-Training: Aligning Language Models with a "Break-Fix" Cycle
di: Haider, Emman, et al.
Pubblicazione: (2024)
di: Haider, Emman, et al.
Pubblicazione: (2024)
P$^2$ Law: Scaling Law for Post-Training After Model Pruning
di: Chen, Xiaodong, et al.
Pubblicazione: (2024)
di: Chen, Xiaodong, et al.
Pubblicazione: (2024)
MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning
di: Liang, Yiqing, et al.
Pubblicazione: (2025)
di: Liang, Yiqing, et al.
Pubblicazione: (2025)
Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts
di: Luo, Sijia, et al.
Pubblicazione: (2026)
di: Luo, Sijia, et al.
Pubblicazione: (2026)
Breaking Training Bottlenecks: Effective and Stable Reinforcement Learning for Coding Models
di: Li, Zongqian, et al.
Pubblicazione: (2026)
di: Li, Zongqian, et al.
Pubblicazione: (2026)
LEAP: LLM-powered End-to-end Automatic Library for Processing Social Science Queries on Unstructured Data
di: Hu, Chuxuan, et al.
Pubblicazione: (2025)
di: Hu, Chuxuan, et al.
Pubblicazione: (2025)
Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training
di: Lai, Song, et al.
Pubblicazione: (2025)
di: Lai, Song, et al.
Pubblicazione: (2025)
Mirror Speculative Decoding: Breaking the Serial Barrier in LLM Inference
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2025)
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2025)
Solaris: Building a Multiplayer Video World Model in Minecraft
di: Savva, Georgy, et al.
Pubblicazione: (2026)
di: Savva, Georgy, et al.
Pubblicazione: (2026)
Do Hallucination Neurons Generalize? Evidence from Cross-Domain Transfer in LLMs
di: Vaddi, Snehit, et al.
Pubblicazione: (2026)
di: Vaddi, Snehit, et al.
Pubblicazione: (2026)
IceBreaker for Conversational Agents: Breaking the First-Message Barrier with Personalized Starters
di: Zheng, Hongwei, et al.
Pubblicazione: (2026)
di: Zheng, Hongwei, et al.
Pubblicazione: (2026)
Evaluating the Unseen Capabilities: How Many Theorems Do LLMs Know?
di: Li, Xiang, et al.
Pubblicazione: (2025)
di: Li, Xiang, et al.
Pubblicazione: (2025)
Breaking Language Barriers or Reinforcing Bias? A Study of Gender and Racial Disparities in Multilingual Contrastive Vision Language Models
di: Sahili, Zahraa Al, et al.
Pubblicazione: (2025)
di: Sahili, Zahraa Al, et al.
Pubblicazione: (2025)
Breaking the Generator Barrier: Disentangled Representation for Generalizable AI-Text Detection
di: Pu, Xiao, et al.
Pubblicazione: (2026)
di: Pu, Xiao, et al.
Pubblicazione: (2026)
Breaking Language Barriers: A Question Answering Dataset for Hindi and Marathi
di: Sabane, Maithili, et al.
Pubblicazione: (2023)
di: Sabane, Maithili, et al.
Pubblicazione: (2023)
Memory Transfer Learning: How Memories are Transferred Across Domains in Coding Agents
di: Kim, Kangsan, et al.
Pubblicazione: (2026)
di: Kim, Kangsan, et al.
Pubblicazione: (2026)
Do Androids Dream of Unseen Puppeteers? Probing for a Conspiracy Mindset in Large Language Models
di: Corso, Francesco, et al.
Pubblicazione: (2025)
di: Corso, Francesco, et al.
Pubblicazione: (2025)
KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning
di: Xu, Hongling, et al.
Pubblicazione: (2025)
di: Xu, Hongling, et al.
Pubblicazione: (2025)
Teams of LLM Agents can Exploit Zero-Day Vulnerabilities
di: Zhu, Yuxuan, et al.
Pubblicazione: (2024)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2024)
Breaking Language Barriers: Equitable Performance in Multilingual Language Models
di: Nagar, Tanay, et al.
Pubblicazione: (2025)
di: Nagar, Tanay, et al.
Pubblicazione: (2025)
STBLLM: Breaking the 1-Bit Barrier with Structured Binary LLMs
di: Dong, Peijie, et al.
Pubblicazione: (2024)
di: Dong, Peijie, et al.
Pubblicazione: (2024)
Breaking Language Barriers in Multilingual Mathematical Reasoning: Insights and Observations
di: Chen, Nuo, et al.
Pubblicazione: (2023)
di: Chen, Nuo, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Trustless Audits without Revealing Data or Models
di: Waiwitlikhit, Suppakit, et al.
Pubblicazione: (2024) -
DRAMA: Unifying Data Retrieval and Analysis for Open-Domain Analytic Queries
di: Hu, Chuxuan, et al.
Pubblicazione: (2025) -
Breaking the Script Barrier in Multilingual Pre-Trained Language Models with Transliteration-Based Post-Training Alignment
di: Xhelili, Orgest, et al.
Pubblicazione: (2024) -
Learning to Generalize Unseen Domains via Multi-Source Meta Learning for Text Classification
di: Hu, Yuxuan, et al.
Pubblicazione: (2024) -
SODIUM: From Open Web Data to Queryable Databases
di: Hu, Chuxuan, et al.
Pubblicazione: (2026)