Code Aesthetics with Agentic Reward Feedback
Fuente:
arXiv
Guardado en:
| Autores principales: | Xiao, Bang, Jiang, Lingjie, Huang, Shaohan, Lv, Tengchao, Huang, Yupan, Wu, Xun, Cui, Lei, Wei, Furu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Textual Aesthetics in Large Language Models
por: Jiang, Lingjie, et al.
Publicado: (2024)
por: Jiang, Lingjie, et al.
Publicado: (2024)
Think Only When You Need with Large Hybrid-Reasoning Models
por: Jiang, Lingjie, et al.
Publicado: (2025)
por: Jiang, Lingjie, et al.
Publicado: (2025)
VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
por: Jiang, Lingjie, et al.
Publicado: (2025)
por: Jiang, Lingjie, et al.
Publicado: (2025)
Mixture of LoRA Experts
por: Wu, Xun, et al.
Publicado: (2024)
por: Wu, Xun, et al.
Publicado: (2024)
RedStone: Curating General, Code, Math, and QA Data for Large Language Models
por: Chang, Yaoyao, et al.
Publicado: (2024)
por: Chang, Yaoyao, et al.
Publicado: (2024)
DocReward: A Document Reward Model for Structuring and Stylizing
por: Liu, Junpeng, et al.
Publicado: (2025)
por: Liu, Junpeng, et al.
Publicado: (2025)
On-Policy RL with Optimal Reward Baseline
por: Hao, Yaru, et al.
Publicado: (2025)
por: Hao, Yaru, et al.
Publicado: (2025)
MH-MoE: Multi-Head Mixture-of-Experts
por: Huang, Shaohan, et al.
Publicado: (2024)
por: Huang, Shaohan, et al.
Publicado: (2024)
Reward Reasoning Model
por: Guo, Jiaxin, et al.
Publicado: (2025)
por: Guo, Jiaxin, et al.
Publicado: (2025)
Geometric-Mean Policy Optimization
por: Zhao, Yuzhong, et al.
Publicado: (2025)
por: Zhao, Yuzhong, et al.
Publicado: (2025)
Multi-Head Mixture-of-Experts
por: Wu, Xun, et al.
Publicado: (2024)
por: Wu, Xun, et al.
Publicado: (2024)
The Era of Agentic Organization: Learning to Organize with Language Models
por: Chi, Zewen, et al.
Publicado: (2025)
por: Chi, Zewen, et al.
Publicado: (2025)
Scaling Data Difficulty: Improving Coding Models via Reinforcement Learning on Fresh and Challenging Problems
por: Li, Zongqian, et al.
Publicado: (2026)
por: Li, Zongqian, et al.
Publicado: (2026)
On-Policy Context Distillation for Language Models
por: Ye, Tianzhu, et al.
Publicado: (2026)
por: Ye, Tianzhu, et al.
Publicado: (2026)
KOSMOS-2.5: A Multimodal Literate Model
por: Lv, Tengchao, et al.
Publicado: (2023)
por: Lv, Tengchao, et al.
Publicado: (2023)
Adapting Large Language Models to Domains via Reading Comprehension
por: Cheng, Daixuan, et al.
Publicado: (2023)
por: Cheng, Daixuan, et al.
Publicado: (2023)
Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts
por: Zhang, Di, et al.
Publicado: (2025)
por: Zhang, Di, et al.
Publicado: (2025)
Online Experiential Learning for Language Models
por: Ye, Tianzhu, et al.
Publicado: (2026)
por: Ye, Tianzhu, et al.
Publicado: (2026)
Black-Box On-Policy Distillation of Large Language Models
por: Ye, Tianzhu, et al.
Publicado: (2025)
por: Ye, Tianzhu, et al.
Publicado: (2025)
Model as a Game: On Numerical and Spatial Consistency for Generative Games
por: Chen, Jingye, et al.
Publicado: (2025)
por: Chen, Jingye, et al.
Publicado: (2025)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
por: Wu, Xun, et al.
Publicado: (2024)
por: Wu, Xun, et al.
Publicado: (2024)
BitNet Distillation
por: Wu, Xun, et al.
Publicado: (2025)
por: Wu, Xun, et al.
Publicado: (2025)
Instruction Pre-Training: Language Models are Supervised Multitask Learners
por: Cheng, Daixuan, et al.
Publicado: (2024)
por: Cheng, Daixuan, et al.
Publicado: (2024)
Thinking Augmented Pre-training
por: Wang, Liang, et al.
Publicado: (2025)
por: Wang, Liang, et al.
Publicado: (2025)
Universal YOCO for Efficient Depth Scaling
por: Sun, Yutao, et al.
Publicado: (2026)
por: Sun, Yutao, et al.
Publicado: (2026)
Computer Environments Elicit General Agentic Intelligence in LLMs
por: Cheng, Daixuan, et al.
Publicado: (2026)
por: Cheng, Daixuan, et al.
Publicado: (2026)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
por: Pan, Xichen, et al.
Publicado: (2023)
por: Pan, Xichen, et al.
Publicado: (2023)
Breaking Training Bottlenecks: Effective and Stable Reinforcement Learning for Coding Models
por: Li, Zongqian, et al.
Publicado: (2026)
por: Li, Zongqian, et al.
Publicado: (2026)
MMLU-CF: A Contamination-free Multi-task Language Understanding Benchmark
por: Zhao, Qihao, et al.
Publicado: (2024)
por: Zhao, Qihao, et al.
Publicado: (2024)
Reasoning with Exploration: An Entropy Perspective
por: Cheng, Daixuan, et al.
Publicado: (2025)
por: Cheng, Daixuan, et al.
Publicado: (2025)
Agentic Reinforcement Learning with Implicit Step Rewards
por: Liu, Xiaoqian, et al.
Publicado: (2025)
por: Liu, Xiaoqian, et al.
Publicado: (2025)
HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition
por: Liu, Yuxuan, et al.
Publicado: (2024)
por: Liu, Yuxuan, et al.
Publicado: (2024)
$Se^2$: Sequential Example Selection for In-Context Learning
por: Liu, Haoyu, et al.
Publicado: (2024)
por: Liu, Haoyu, et al.
Publicado: (2024)
Sparse-BitNet: 1.58-bit LLMs are Naturally Friendly to Semi-Structured Sparsity
por: Zhang, Di, et al.
Publicado: (2026)
por: Zhang, Di, et al.
Publicado: (2026)
Improving Domain Adaptation through Extended-Text Reading Comprehension
por: Jiang, Ting, et al.
Publicado: (2024)
por: Jiang, Ting, et al.
Publicado: (2024)
BitNet b1.58 2B4T Technical Report
por: Ma, Shuming, et al.
Publicado: (2025)
por: Ma, Shuming, et al.
Publicado: (2025)
Shorten After You're Right: Lazy Length Penalties for Reasoning RL
por: Yuan, Danlong, et al.
Publicado: (2025)
por: Yuan, Danlong, et al.
Publicado: (2025)
You Only Cache Once: Decoder-Decoder Architectures for Language Models
por: Sun, Yutao, et al.
Publicado: (2024)
por: Sun, Yutao, et al.
Publicado: (2024)
MoRA: High-Rank Updating for Parameter-Efficient Fine-Tuning
por: Jiang, Ting, et al.
Publicado: (2024)
por: Jiang, Ting, et al.
Publicado: (2024)
The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits
por: Ma, Shuming, et al.
Publicado: (2024)
por: Ma, Shuming, et al.
Publicado: (2024)
Ejemplares similares
-
Textual Aesthetics in Large Language Models
por: Jiang, Lingjie, et al.
Publicado: (2024) -
Think Only When You Need with Large Hybrid-Reasoning Models
por: Jiang, Lingjie, et al.
Publicado: (2025) -
VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
por: Jiang, Lingjie, et al.
Publicado: (2025) -
Mixture of LoRA Experts
por: Wu, Xun, et al.
Publicado: (2024) -
RedStone: Curating General, Code, Math, and QA Data for Large Language Models
por: Chang, Yaoyao, et al.
Publicado: (2024)