CodecLM: Aligning Language Models with Tailored Synthetic Data
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Zifeng, Li, Chun-Liang, Perot, Vincent, Le, Long T., Miao, Jin, Zhang, Zizhao, Lee, Chen-Yu, Pfister, Tomas |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CaLM: Contrasting Large and Small Language Models to Verify Grounded Generation
by: Hsu, I-Hung, et al.
Published: (2024)
by: Hsu, I-Hung, et al.
Published: (2024)
Chain-of-Table: Evolving Tables in the Reasoning Chain for Table Understanding
by: Wang, Zilong, et al.
Published: (2024)
by: Wang, Zilong, et al.
Published: (2024)
Reverse Thinking Makes LLMs Stronger Reasoners
by: Chen, Justin Chih-Yao, et al.
Published: (2024)
by: Chen, Justin Chih-Yao, et al.
Published: (2024)
Speculative RAG: Enhancing Retrieval Augmented Generation through Drafting
by: Wang, Zilong, et al.
Published: (2024)
by: Wang, Zilong, et al.
Published: (2024)
SQL-PaLM: Improved Large Language Model Adaptation for Text-to-SQL (extended)
by: Sun, Ruoxi, et al.
Published: (2023)
by: Sun, Ruoxi, et al.
Published: (2023)
DiffLM: Controllable Synthetic Data Generation via Diffusion Language Models
by: Zhou, Ying, et al.
Published: (2024)
by: Zhou, Ying, et al.
Published: (2024)
Aligning Large Language Models via Fully Self-Synthetic Data
by: Yin, Shangjian, et al.
Published: (2025)
by: Yin, Shangjian, et al.
Published: (2025)
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
by: Li, Gaotang, et al.
Published: (2026)
by: Li, Gaotang, et al.
Published: (2026)
Found in the Middle: Calibrating Positional Attention Bias Improves Long Context Utilization
by: Hsieh, Cheng-Yu, et al.
Published: (2024)
by: Hsieh, Cheng-Yu, et al.
Published: (2024)
Magnet: Multi-turn Tool-use Data Synthesis and Distillation via Graph Translation
by: Yin, Fan, et al.
Published: (2025)
by: Yin, Fan, et al.
Published: (2025)
LMDX: Language Model-based Document Information Extraction and Localization
by: Perot, Vincent, et al.
Published: (2023)
by: Perot, Vincent, et al.
Published: (2023)
CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling
by: Sarkar, Sayan Deb, et al.
Published: (2026)
by: Sarkar, Sayan Deb, et al.
Published: (2026)
Speculative Knowledge Distillation: Bridging the Teacher-Student Gap Through Interleaved Sampling
by: Xu, Wenda, et al.
Published: (2024)
by: Xu, Wenda, et al.
Published: (2024)
TacoLM: GaTed Attention Equipped Codec Language Model are Efficient Zero-Shot Text to Speech Synthesizers
by: Song, Yakun, et al.
Published: (2024)
by: Song, Yakun, et al.
Published: (2024)
TableRAG: Million-Token Table Understanding with Language Models
by: Chen, Si-An, et al.
Published: (2024)
by: Chen, Si-An, et al.
Published: (2024)
SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec
by: Qiang, Chunyu, et al.
Published: (2025)
by: Qiang, Chunyu, et al.
Published: (2025)
HEART: Emotionally-Driven Test-Time Scaling of Language Models
by: Pinto, Gabriela, et al.
Published: (2025)
by: Pinto, Gabriela, et al.
Published: (2025)
JPEG-LM: LLMs as Image Generators with Canonical Codec Representations
by: Han, Xiaochuang, et al.
Published: (2024)
by: Han, Xiaochuang, et al.
Published: (2024)
SQL-GEN: Bridging the Dialect Gap for Text-to-SQL Via Synthetic Data And Model Merging
by: Pourreza, Mohammadreza, et al.
Published: (2024)
by: Pourreza, Mohammadreza, et al.
Published: (2024)
ZeroLM: Data-Free Transformer Architecture Search for Language Models
by: Chen, Zhen-Song, et al.
Published: (2025)
by: Chen, Zhen-Song, et al.
Published: (2025)
Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline
by: Lee, Tony, et al.
Published: (2026)
by: Lee, Tony, et al.
Published: (2026)
PolicyBank: Evolving Policy Understanding for LLM Agents
by: Choi, Jihye, et al.
Published: (2026)
by: Choi, Jihye, et al.
Published: (2026)
Heterogeneous Swarms: Jointly Optimizing Model Roles and Weights for Multi-LLM Systems
by: Feng, Shangbin, et al.
Published: (2025)
by: Feng, Shangbin, et al.
Published: (2025)
Effective Large Language Model Adaptation for Improved Grounding and Citation Generation
by: Ye, Xi, et al.
Published: (2023)
by: Ye, Xi, et al.
Published: (2023)
Icon$^{2}$: Aligning Large Language Models Using Self-Synthetic Preference Data via Inherent Regulation
by: Chen, Qiyuan, et al.
Published: (2025)
by: Chen, Qiyuan, et al.
Published: (2025)
Exploring Mathematical Extrapolation of Large Language Models with Synthetic Data
by: Li, Haolong, et al.
Published: (2024)
by: Li, Haolong, et al.
Published: (2024)
LM-SPT: LM-Aligned Semantic Distillation for Speech Tokenization
by: Jo, Daejin, et al.
Published: (2025)
by: Jo, Daejin, et al.
Published: (2025)
ReaLM: Reflection-Enhanced Autonomous Reasoning with Small Language Models
by: Xu, Yuanfeng, et al.
Published: (2025)
by: Xu, Yuanfeng, et al.
Published: (2025)
Aligning Teacher with Student Preferences for Tailored Training Data Generation
by: Liu, Yantao, et al.
Published: (2024)
by: Liu, Yantao, et al.
Published: (2024)
Model Swarms: Collaborative Search to Adapt LLM Experts via Swarm Intelligence
by: Feng, Shangbin, et al.
Published: (2024)
by: Feng, Shangbin, et al.
Published: (2024)
DATE-LM: Benchmarking Data Attribution Evaluation for Large Language Models
by: Jiao, Cathy, et al.
Published: (2025)
by: Jiao, Cathy, et al.
Published: (2025)
fMRI-LM: Towards a Universal Foundation Model for Language-Aligned fMRI Understanding
by: Wei, Yuxiang, et al.
Published: (2025)
by: Wei, Yuxiang, et al.
Published: (2025)
AntLM: Bridging Causal and Masked Language Models
by: Yu, Xinru, et al.
Published: (2024)
by: Yu, Xinru, et al.
Published: (2024)
Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model
by: Ye, Zhen, et al.
Published: (2024)
by: Ye, Zhen, et al.
Published: (2024)
CD4LM: Consistency Distillation and aDaptive Decoding for Diffusion Language Models
by: Liang, Yihao, et al.
Published: (2026)
by: Liang, Yihao, et al.
Published: (2026)
Evaluating Language Models as Synthetic Data Generators
by: Kim, Seungone, et al.
Published: (2024)
by: Kim, Seungone, et al.
Published: (2024)
Replicating ReLM Results: Validating Large Language Models with ReLM
by: Adamson, Reece, et al.
Published: (2025)
by: Adamson, Reece, et al.
Published: (2025)
Chain of Agents: Large Language Models Collaborating on Long-Context Tasks
by: Zhang, Yusen, et al.
Published: (2024)
by: Zhang, Yusen, et al.
Published: (2024)
PlanGEN: A Multi-Agent Framework for Generating Planning and Reasoning Trajectories for Complex Problem Solving
by: Parmar, Mihir, et al.
Published: (2025)
by: Parmar, Mihir, et al.
Published: (2025)
SynLexLM: Scaling Legal LLMs with Synthetic Data and Curriculum Learning
by: Upadhyay, Ojasw, et al.
Published: (2025)
by: Upadhyay, Ojasw, et al.
Published: (2025)
Similar Items
-
CaLM: Contrasting Large and Small Language Models to Verify Grounded Generation
by: Hsu, I-Hung, et al.
Published: (2024) -
Chain-of-Table: Evolving Tables in the Reasoning Chain for Table Understanding
by: Wang, Zilong, et al.
Published: (2024) -
Reverse Thinking Makes LLMs Stronger Reasoners
by: Chen, Justin Chih-Yao, et al.
Published: (2024) -
Speculative RAG: Enhancing Retrieval Augmented Generation through Drafting
by: Wang, Zilong, et al.
Published: (2024) -
SQL-PaLM: Improved Large Language Model Adaptation for Text-to-SQL (extended)
by: Sun, Ruoxi, et al.
Published: (2023)