Divide-or-Conquer? Which Part Should You Distill Your LLM?
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Zhuofeng, Bai, He, Zhang, Aonan, Gu, Jiatao, Vydiswaran, VG Vinod, Jaitly, Navdeep, Zhang, Yizhe |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PLANNER: Generating Diversified Paragraph via Latent Language Diffusion Model
por: Zhang, Yizhe, et al.
Publicado: (2023)
por: Zhang, Yizhe, et al.
Publicado: (2023)
What Makes the Preferred Thinking Direction for LLMs in Multiple-choice Questions?
por: Zhang, Yizhe, et al.
Publicado: (2025)
por: Zhang, Yizhe, et al.
Publicado: (2025)
SAGE: Steering Dialog Generation with Future-Aware State-Action Augmentation
por: Zhang, Yizhe, et al.
Publicado: (2025)
por: Zhang, Yizhe, et al.
Publicado: (2025)
Probing the Multi-turn Planning Capabilities of LLMs via 20 Question Games
por: Zhang, Yizhe, et al.
Publicado: (2023)
por: Zhang, Yizhe, et al.
Publicado: (2023)
How Far Are We from Intelligent Visual Deductive Reasoning?
por: Zhang, Yizhe, et al.
Publicado: (2024)
por: Zhang, Yizhe, et al.
Publicado: (2024)
Matryoshka Diffusion Models
por: Gu, Jiatao, et al.
Publicado: (2023)
por: Gu, Jiatao, et al.
Publicado: (2023)
KGLens: Towards Efficient and Effective Knowledge Probing of Large Language Models with Knowledge Graphs
por: Zheng, Shangshang, et al.
Publicado: (2023)
por: Zheng, Shangshang, et al.
Publicado: (2023)
Embarrassingly Simple Self-Distillation Improves Code Generation
por: Zhang, Ruixiang, et al.
Publicado: (2026)
por: Zhang, Ruixiang, et al.
Publicado: (2026)
Flexible Language Modeling in Continuous Space with Transformer-based Autoregressive Flows
por: Zhang, Ruixiang, et al.
Publicado: (2025)
por: Zhang, Ruixiang, et al.
Publicado: (2025)
DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation
por: Gong, Shansan, et al.
Publicado: (2025)
por: Gong, Shansan, et al.
Publicado: (2025)
SpeakStream: Streaming Text-to-Speech with Interleaved Data
por: Bai, Richard He, et al.
Publicado: (2025)
por: Bai, Richard He, et al.
Publicado: (2025)
Improving GFlowNets for Text-to-Image Diffusion Alignment
por: Zhang, Dinghuai, et al.
Publicado: (2024)
por: Zhang, Dinghuai, et al.
Publicado: (2024)
Omni-Router: Sharing Routing Decisions in Sparse Mixture-of-Experts for Speech Recognition
por: Gu, Zijin, et al.
Publicado: (2025)
por: Gu, Zijin, et al.
Publicado: (2025)
Rephrasing the Web: A Recipe for Compute and Data-Efficient Language Modeling
por: Maini, Pratyush, et al.
Publicado: (2024)
por: Maini, Pratyush, et al.
Publicado: (2024)
Continuously Augmented Discrete Diffusion model for Categorical Generative Modeling
por: Zheng, Huangjie, et al.
Publicado: (2025)
por: Zheng, Huangjie, et al.
Publicado: (2025)
ChipChat: Low-Latency Cascaded Conversational Agent in MLX
por: Likhomanenko, Tatiana, et al.
Publicado: (2025)
por: Likhomanenko, Tatiana, et al.
Publicado: (2025)
CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning
por: He, Jie, et al.
Publicado: (2025)
por: He, Jie, et al.
Publicado: (2025)
Eliciting In-context Retrieval and Reasoning for Long-context Large Language Models
por: Qiu, Yifu, et al.
Publicado: (2025)
por: Qiu, Yifu, et al.
Publicado: (2025)
DART: Denoising Autoregressive Transformer for Scalable Text-to-Image Generation
por: Gu, Jiatao, et al.
Publicado: (2024)
por: Gu, Jiatao, et al.
Publicado: (2024)
Revisiting ASR Error Correction with Specialized Models
por: Gu, Zijin, et al.
Publicado: (2024)
por: Gu, Zijin, et al.
Publicado: (2024)
LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning
por: Kang, Haoqiang, et al.
Publicado: (2025)
por: Kang, Haoqiang, et al.
Publicado: (2025)
When Does Divide and Conquer Work for Long Context LLM? A Noise Decomposition Framework
por: Xu, Zhen, et al.
Publicado: (2025)
por: Xu, Zhen, et al.
Publicado: (2025)
Big Reasoning with Small Models: Instruction Retrieval at Inference Time
por: Alkiek, Kenan, et al.
Publicado: (2025)
por: Alkiek, Kenan, et al.
Publicado: (2025)
An Examination on the Effectiveness of Divide-and-Conquer Prompting in Large Language Models
por: Zhang, Yizhou, et al.
Publicado: (2024)
por: Zhang, Yizhou, et al.
Publicado: (2024)
Kaleido Diffusion: Improving Conditional Diffusion Models with Autoregressive Latent Modeling
por: Gu, Jiatao, et al.
Publicado: (2024)
por: Gu, Jiatao, et al.
Publicado: (2024)
Should You Use Your Large Language Model to Explore or Exploit?
por: Harris, Keegan, et al.
Publicado: (2025)
por: Harris, Keegan, et al.
Publicado: (2025)
dMel: Speech Tokenization made Simple
por: Bai, Richard He, et al.
Publicado: (2024)
por: Bai, Richard He, et al.
Publicado: (2024)
Accurate and Scalable Matrix Mechanisms via Divide and Conquer
por: He, Guanlin, et al.
Publicado: (2026)
por: He, Guanlin, et al.
Publicado: (2026)
Divide, Reweight, and Conquer: A Logit Arithmetic Approach for In-Context Learning
por: Huang, Chengsong, et al.
Publicado: (2024)
por: Huang, Chengsong, et al.
Publicado: (2024)
Training Software Engineering Agents and Verifiers with SWE-Gym
por: Pan, Jiayi, et al.
Publicado: (2024)
por: Pan, Jiayi, et al.
Publicado: (2024)
LLM Unlearning Should Be Form-Independent
por: Ye, Xiaotian, et al.
Publicado: (2025)
por: Ye, Xiaotian, et al.
Publicado: (2025)
TypeScore: A Text Fidelity Metric for Text-to-Image Generative Models
por: Sampaio, Georgia Gabriela, et al.
Publicado: (2024)
por: Sampaio, Georgia Gabriela, et al.
Publicado: (2024)
Divide (Text) and Conquer (Sentiment): Improved Sentiment Classification by Constituent Conflict Resolution
por: Kościałkowski, Jan, et al.
Publicado: (2025)
por: Kościałkowski, Jan, et al.
Publicado: (2025)
Hierarchical Divide-and-Conquer for Fine-Grained Alignment in LLM-Based Medical Evaluation
por: Zheng, Shunfan, et al.
Publicado: (2025)
por: Zheng, Shunfan, et al.
Publicado: (2025)
Target Concrete Score Matching: A Holistic Framework for Discrete Diffusion
por: Zhang, Ruixiang, et al.
Publicado: (2025)
por: Zhang, Ruixiang, et al.
Publicado: (2025)
Enhancing LLM Character-Level Manipulation via Divide and Conquer
por: Xiong, Zhen, et al.
Publicado: (2025)
por: Xiong, Zhen, et al.
Publicado: (2025)
Which Side Are You On? A Multi-task Dataset for End-to-End Argument Summarisation and Evaluation
por: Li, Hao, et al.
Publicado: (2024)
por: Li, Hao, et al.
Publicado: (2024)
GraphDancer: Training LLMs to Explore and Reason over Graphs via Two-Stage Curriculum Post-Training
por: Bai, Yuyang, et al.
Publicado: (2026)
por: Bai, Yuyang, et al.
Publicado: (2026)
Scaling Properties of Continuous Diffusion Spoken Language Models
por: Ramapuram, Jason, et al.
Publicado: (2026)
por: Ramapuram, Jason, et al.
Publicado: (2026)
SimpleFold: Folding Proteins is Simpler than You Think
por: Wang, Yuyang, et al.
Publicado: (2025)
por: Wang, Yuyang, et al.
Publicado: (2025)
Ejemplares similares
-
PLANNER: Generating Diversified Paragraph via Latent Language Diffusion Model
por: Zhang, Yizhe, et al.
Publicado: (2023) -
What Makes the Preferred Thinking Direction for LLMs in Multiple-choice Questions?
por: Zhang, Yizhe, et al.
Publicado: (2025) -
SAGE: Steering Dialog Generation with Future-Aware State-Action Augmentation
por: Zhang, Yizhe, et al.
Publicado: (2025) -
Probing the Multi-turn Planning Capabilities of LLMs via 20 Question Games
por: Zhang, Yizhe, et al.
Publicado: (2023) -
How Far Are We from Intelligent Visual Deductive Reasoning?
por: Zhang, Yizhe, et al.
Publicado: (2024)