Sentence-Level or Token-Level? A Comprehensive Study on Knowledge Distillation
Fuente:
arXiv
Guardado en:
| Autores principales: | Wei, Jingxuan, Sun, Linzhuang, Leng, Yichong, Tan, Xu, Yu, Bihui, Guo, Ruifeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Survey on Image-text Multimodal Models
por: Guo, Ruifeng, et al.
Publicado: (2023)
por: Guo, Ruifeng, et al.
Publicado: (2023)
Efficient-Empathy: Towards Efficient and Effective Selection of Empathy Data
por: Sun, Linzhuang, et al.
Publicado: (2024)
por: Sun, Linzhuang, et al.
Publicado: (2024)
BEATS: Optimizing LLM Mathematical Capabilities with BackVerify and Adaptive Disambiguate based Efficient Tree Search
por: Sun, Linzhuang, et al.
Publicado: (2024)
por: Sun, Linzhuang, et al.
Publicado: (2024)
Retrieval Meets Reasoning: Even High-school Textbook Knowledge Benefits Multimodal Reasoning
por: Tan, Cheng, et al.
Publicado: (2024)
por: Tan, Cheng, et al.
Publicado: (2024)
Distilling Token-Trained Models into Byte-Level Models
por: Bao, Zishuo, et al.
Publicado: (2026)
por: Bao, Zishuo, et al.
Publicado: (2026)
Synth-Empathy: Towards High-Quality Synthetic Empathy Data
por: Liang, Hao, et al.
Publicado: (2024)
por: Liang, Hao, et al.
Publicado: (2024)
LLaVA-NeuMT: Selective Layer-Neuron Modulation for Efficient Multilingual Multimodal Translation
por: Wei, Jingxuan, et al.
Publicado: (2025)
por: Wei, Jingxuan, et al.
Publicado: (2025)
Rethinking Text-to-SQL: Dynamic Multi-turn SQL Interaction for Real-world Database Exploration
por: Sun, Linzhuang, et al.
Publicado: (2025)
por: Sun, Linzhuang, et al.
Publicado: (2025)
EGAD: Entropy-Guided Adaptive Distillation for Token-Level Knowledge Transfer
por: Zhang, Hao, et al.
Publicado: (2026)
por: Zhang, Hao, et al.
Publicado: (2026)
MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought Verification
por: Sun, Linzhuang, et al.
Publicado: (2025)
por: Sun, Linzhuang, et al.
Publicado: (2025)
Thinking with Drafting: Optical Decompression via Logical Reconstruction
por: Wei, Jingxuan, et al.
Publicado: (2026)
por: Wei, Jingxuan, et al.
Publicado: (2026)
ChartMind: A Comprehensive Benchmark for Complex Real-world Multimodal Chart Question Answering
por: Wei, Jingxuan, et al.
Publicado: (2025)
por: Wei, Jingxuan, et al.
Publicado: (2025)
How RL Unlocks the Aha Moment in Geometric Interleaved Reasoning
por: Zhang, Xiangxiang, et al.
Publicado: (2026)
por: Zhang, Xiangxiang, et al.
Publicado: (2026)
Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models
por: Cui, Xiao, et al.
Publicado: (2024)
por: Cui, Xiao, et al.
Publicado: (2024)
Comprehensive and Efficient Distillation for Lightweight Sentiment Analysis Models
por: Xie, Guangyu, et al.
Publicado: (2025)
por: Xie, Guangyu, et al.
Publicado: (2025)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
por: Zhang, Songming, et al.
Publicado: (2025)
por: Zhang, Songming, et al.
Publicado: (2025)
Cross-Tokenizer LLM Distillation through a Byte-Level Interface
por: Singh, Avyav Kumar, et al.
Publicado: (2026)
por: Singh, Avyav Kumar, et al.
Publicado: (2026)
Reconsidering Sentence-Level Sign Language Translation
por: Tanzer, Garrett, et al.
Publicado: (2024)
por: Tanzer, Garrett, et al.
Publicado: (2024)
Multi-Stage Balanced Distillation: Addressing Long-Tail Challenges in Sequence-Level Knowledge Distillation
por: Zhou, Yuhang, et al.
Publicado: (2024)
por: Zhou, Yuhang, et al.
Publicado: (2024)
Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood
por: Lin, Xingyu, et al.
Publicado: (2026)
por: Lin, Xingyu, et al.
Publicado: (2026)
Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision
por: Sun, Lingzhuang, et al.
Publicado: (2026)
por: Sun, Lingzhuang, et al.
Publicado: (2026)
ChartReasoner: Code-Driven Modality Bridging for Long-Chain Reasoning in Chart Question Answering
por: Jia, Caijun, et al.
Publicado: (2025)
por: Jia, Caijun, et al.
Publicado: (2025)
Boosting the Power of Small Multimodal Reasoning Models to Match Larger Models with Self-Consistency Training
por: Tan, Cheng, et al.
Publicado: (2023)
por: Tan, Cheng, et al.
Publicado: (2023)
Cross-Preference Learning for Sentence-Level and Context-Aware Machine Translation
por: Li, Ying, et al.
Publicado: (2026)
por: Li, Ying, et al.
Publicado: (2026)
SentGuard: Sentence-Level Streaming Guardrails for Large Language Models
por: Yu, Jiaqi, et al.
Publicado: (2026)
por: Yu, Jiaqi, et al.
Publicado: (2026)
SD-HuBERT: Sentence-Level Self-Distillation Induces Syllabic Organization in HuBERT
por: Cho, Cheol Jun, et al.
Publicado: (2023)
por: Cho, Cheol Jun, et al.
Publicado: (2023)
Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Markov Likelihood
por: Lin, Xingyu, et al.
Publicado: (2025)
por: Lin, Xingyu, et al.
Publicado: (2025)
Computational Sentence-level Metrics Predicting Human Sentence Comprehension
por: Sun, Kun, et al.
Publicado: (2024)
por: Sun, Kun, et al.
Publicado: (2024)
From Words to Structured Visuals: A Benchmark and Framework for Text-to-Diagram Generation and Editing
por: Wei, Jingxuan, et al.
Publicado: (2024)
por: Wei, Jingxuan, et al.
Publicado: (2024)
ImpScore: A Learnable Metric For Quantifying The Implicitness Level of Sentence
por: Wang, Yuxin, et al.
Publicado: (2024)
por: Wang, Yuxin, et al.
Publicado: (2024)
Thunder-NUBench: A Benchmark for LLMs' Sentence-Level Negation Understanding
por: So, Yeonkyoung, et al.
Publicado: (2025)
por: So, Yeonkyoung, et al.
Publicado: (2025)
Memorization Inheritance in Sequence-Level Knowledge Distillation for Neural Machine Translation
por: Dankers, Verna, et al.
Publicado: (2025)
por: Dankers, Verna, et al.
Publicado: (2025)
Predicting Sentence-Level Factuality of News and Bias of Media Outlets
por: Vargas, Francielle, et al.
Publicado: (2023)
por: Vargas, Francielle, et al.
Publicado: (2023)
ResearchPulse: Building Method-Experiment Chains through Multi-Document Scientific Inference
por: Chen, Qi, et al.
Publicado: (2025)
por: Chen, Qi, et al.
Publicado: (2025)
Beyond Tokens: Concept-Level Training Objectives for LLMs
por: Iyer, Laya, et al.
Publicado: (2026)
por: Iyer, Laya, et al.
Publicado: (2026)
Pretraining with Token-Level Adaptive Latent Chain-of-Thought
por: Zeng, Boyi, et al.
Publicado: (2026)
por: Zeng, Boyi, et al.
Publicado: (2026)
Tailoring Instructions to Student's Learning Levels Boosts Knowledge Distillation
por: Ren, Yuxin, et al.
Publicado: (2023)
por: Ren, Yuxin, et al.
Publicado: (2023)
Cross-Lingual Knowledge Distillation for Answer Sentence Selection in Low-Resource Languages
por: Gupta, Shivanshu, et al.
Publicado: (2023)
por: Gupta, Shivanshu, et al.
Publicado: (2023)
CoheMark: A Novel Sentence-Level Watermark for Enhanced Text Quality
por: Zhang, Junyan, et al.
Publicado: (2025)
por: Zhang, Junyan, et al.
Publicado: (2025)
Enhancing Cross-Tokenizer Knowledge Distillation with Contextual Dynamical Mapping
por: Chen, Yijie, et al.
Publicado: (2025)
por: Chen, Yijie, et al.
Publicado: (2025)
Ejemplares similares
-
A Survey on Image-text Multimodal Models
por: Guo, Ruifeng, et al.
Publicado: (2023) -
Efficient-Empathy: Towards Efficient and Effective Selection of Empathy Data
por: Sun, Linzhuang, et al.
Publicado: (2024) -
BEATS: Optimizing LLM Mathematical Capabilities with BackVerify and Adaptive Disambiguate based Efficient Tree Search
por: Sun, Linzhuang, et al.
Publicado: (2024) -
Retrieval Meets Reasoning: Even High-school Textbook Knowledge Benefits Multimodal Reasoning
por: Tan, Cheng, et al.
Publicado: (2024) -
Distilling Token-Trained Models into Byte-Level Models
por: Bao, Zishuo, et al.
Publicado: (2026)