Guardado en:
| Autores principales: | Zheng, Tong, Liu, Haolin, Huang, Chengsong, Bao, Huiwen, Zhang, Sheng, Liu, Rui, Dai, Runpeng, Chen, Ruibo, Liu, Chenxi, Xiong, Tianyi, Wu, Xidong, Zhang, Hongming, Huang, Heng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2605.08083 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Parallel-R1: Towards Parallel Thinking via Reinforcement Learning
por: Zheng, Tong, et al.
Publicado: (2025)
por: Zheng, Tong, et al.
Publicado: (2025)
Parallel-Probe: Towards Efficient Parallel Thinking via 2D Probing
por: Zheng, Tong, et al.
Publicado: (2026)
por: Zheng, Tong, et al.
Publicado: (2026)
Learning from Self-Debate: Preparing Reasoning Models for Multi-Agent Debate
por: Liu, Chenxi, et al.
Publicado: (2026)
por: Liu, Chenxi, et al.
Publicado: (2026)
G-Zero: Self-Play for Open-Ended Generation from Zero Data
por: Huang, Chengsong, et al.
Publicado: (2026)
por: Huang, Chengsong, et al.
Publicado: (2026)
RelayLLM: Efficient Reasoning via Collaborative Decoding
por: Huang, Chengsong, et al.
Publicado: (2026)
por: Huang, Chengsong, et al.
Publicado: (2026)
Efficient Test-Time Scaling via Self-Calibration
por: Huang, Chengsong, et al.
Publicado: (2025)
por: Huang, Chengsong, et al.
Publicado: (2025)
Modality-Balancing Preference Optimization of Large Multimodal Models by Adversarial Negative Mining
por: Liu, Chenxi, et al.
Publicado: (2025)
por: Liu, Chenxi, et al.
Publicado: (2025)
Few-Shot Class Incremental Learning with Attention-Aware Self-Adaptive Prompt
por: Liu, Chenxi, et al.
Publicado: (2024)
por: Liu, Chenxi, et al.
Publicado: (2024)
Taming Overconfidence in LLMs: Reward Calibration in RLHF
por: Leng, Jixuan, et al.
Publicado: (2024)
por: Leng, Jixuan, et al.
Publicado: (2024)
TestExplora: Benchmarking LLMs for Proactive Bug Discovery via Repository-Level Test Generation
por: Liu, Steven, et al.
Publicado: (2026)
por: Liu, Steven, et al.
Publicado: (2026)
Training Data Efficiency in Multimodal Process Reward Models
por: Li, Jinyuan, et al.
Publicado: (2026)
por: Li, Jinyuan, et al.
Publicado: (2026)
Your Vision-Language Model Itself Is a Strong Filter: Towards High-Quality Instruction Tuning with Data Selection
por: Chen, Ruibo, et al.
Publicado: (2024)
por: Chen, Ruibo, et al.
Publicado: (2024)
Reinforcing Multimodal Reasoning Against Visual Degradation
por: Liu, Rui, et al.
Publicado: (2026)
por: Liu, Rui, et al.
Publicado: (2026)
Asymmetric Conflict and Synergy in Post-training for LLM-based Multilingual Machine Translation
por: Zheng, Tong, et al.
Publicado: (2025)
por: Zheng, Tong, et al.
Publicado: (2025)
Agentic AutoSurvey: Let LLMs Survey LLMs
por: Liu, Yixin, et al.
Publicado: (2025)
por: Liu, Yixin, et al.
Publicado: (2025)
ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation
por: Wang, Kaishen, et al.
Publicado: (2025)
por: Wang, Kaishen, et al.
Publicado: (2025)
Improving Text-to-Image Generation with Input-Side Inference-Time Scaling
por: Chen, Ruibo, et al.
Publicado: (2025)
por: Chen, Ruibo, et al.
Publicado: (2025)
Position: Agentic Evolution is the Path to Evolving LLMs
por: Lin, Minhua, et al.
Publicado: (2026)
por: Lin, Minhua, et al.
Publicado: (2026)
A Watermark for Order-Agnostic Language Models
por: Chen, Ruibo, et al.
Publicado: (2024)
por: Chen, Ruibo, et al.
Publicado: (2024)
APTBench: Benchmarking Agentic Potential of Base LLMs During Pre-Training
por: Qin, Jiarui, et al.
Publicado: (2025)
por: Qin, Jiarui, et al.
Publicado: (2025)
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
por: Dai, Runpeng, et al.
Publicado: (2025)
por: Dai, Runpeng, et al.
Publicado: (2025)
Automated Discovery of Test Oracles for Database Management Systems Using LLMs
por: Mang, Qiuyang, et al.
Publicado: (2025)
por: Mang, Qiuyang, et al.
Publicado: (2025)
A Bayesian Approach to Harnessing the Power of LLMs in Authorship Attribution
por: Hu, Zhengmian, et al.
Publicado: (2024)
por: Hu, Zhengmian, et al.
Publicado: (2024)
Model Correlation Detection via Random Selection Probing
por: Chen, Ruibo, et al.
Publicado: (2025)
por: Chen, Ruibo, et al.
Publicado: (2025)
You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories
por: Wei, Zhepei, et al.
Publicado: (2026)
por: Wei, Zhepei, et al.
Publicado: (2026)
A Multi-Task Evaluation of LLMs' Processing of Academic Text Input
por: Li, Tianyi, et al.
Publicado: (2025)
por: Li, Tianyi, et al.
Publicado: (2025)
From Lists to Emojis: How Format Bias Affects Model Alignment
por: Zhang, Xuanchang, et al.
Publicado: (2024)
por: Zhang, Xuanchang, et al.
Publicado: (2024)
CrossWordBench: Evaluating the Reasoning Capabilities of LLMs and LVLMs with Controllable Puzzle Generation
por: Leng, Jixuan, et al.
Publicado: (2025)
por: Leng, Jixuan, et al.
Publicado: (2025)
Client-Centric Federated Adaptive Optimization
por: Sun, Jianhui, et al.
Publicado: (2025)
por: Sun, Jianhui, et al.
Publicado: (2025)
Towards Copyright Protection for Knowledge Bases of Retrieval-augmented Language Models via Reasoning
por: Guo, Junfeng, et al.
Publicado: (2025)
por: Guo, Junfeng, et al.
Publicado: (2025)
Guided Self-Evolving LLMs with Minimal Human Supervision
por: Yu, Wenhao, et al.
Publicado: (2025)
por: Yu, Wenhao, et al.
Publicado: (2025)
Lita: Light Agent Uncovers the Agentic Coding Capabilities of LLMs
por: Dai, Hankun, et al.
Publicado: (2025)
por: Dai, Hankun, et al.
Publicado: (2025)
Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Following
por: Xiong, Tianyi, et al.
Publicado: (2025)
por: Xiong, Tianyi, et al.
Publicado: (2025)
The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
por: Zhang, Guibin, et al.
Publicado: (2025)
por: Zhang, Guibin, et al.
Publicado: (2025)
Toward Robust Multilingual Adaptation of LLMs for Low-Resource Languages
por: Li, Haolin, et al.
Publicado: (2025)
por: Li, Haolin, et al.
Publicado: (2025)
Are LLMs Ready for Neural-integrated Mechanistic Modeling? A Benchmark and Agentic Framework
por: Guan, Zihan, et al.
Publicado: (2026)
por: Guan, Zihan, et al.
Publicado: (2026)
Improved Unbiased Watermark for Large Language Models
por: Chen, Ruibo, et al.
Publicado: (2025)
por: Chen, Ruibo, et al.
Publicado: (2025)
GEM: A Gym for Agentic LLMs
por: Liu, Zichen, et al.
Publicado: (2025)
por: Liu, Zichen, et al.
Publicado: (2025)
Do LLMs "Feel"? Emotion Circuits Discovery and Control
por: Wang, Chenxi, et al.
Publicado: (2025)
por: Wang, Chenxi, et al.
Publicado: (2025)
Privacy-Preserving LLMs Routing
por: Wu, Xidong, et al.
Publicado: (2026)
por: Wu, Xidong, et al.
Publicado: (2026)
Ejemplares similares
-
Parallel-R1: Towards Parallel Thinking via Reinforcement Learning
por: Zheng, Tong, et al.
Publicado: (2025) -
Parallel-Probe: Towards Efficient Parallel Thinking via 2D Probing
por: Zheng, Tong, et al.
Publicado: (2026) -
Learning from Self-Debate: Preparing Reasoning Models for Multi-Agent Debate
por: Liu, Chenxi, et al.
Publicado: (2026) -
G-Zero: Self-Play for Open-Ended Generation from Zero Data
por: Huang, Chengsong, et al.
Publicado: (2026) -
RelayLLM: Efficient Reasoning via Collaborative Decoding
por: Huang, Chengsong, et al.
Publicado: (2026)