Representation Deficiency in Masked Language Modeling
Fuente:
arXiv
Guardado en:
| Autores principales: | Meng, Yu, Krishnan, Jitin, Wang, Sinong, Wang, Qifan, Mao, Yuning, Fang, Han, Ghazvininejad, Marjan, Han, Jiawei, Zettlemoyer, Luke |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ALMA: Alignment with Minimal Annotation
por: Yasunaga, Michihiro, et al.
Publicado: (2024)
por: Yasunaga, Michihiro, et al.
Publicado: (2024)
JPEG-LM: LLMs as Image Generators with Canonical Codec Representations
por: Han, Xiaochuang, et al.
Publicado: (2024)
por: Han, Xiaochuang, et al.
Publicado: (2024)
Learning Multiplex Representations on Text-Attributed Graphs with One Language Model Encoder
por: Jin, Bowen, et al.
Publicado: (2023)
por: Jin, Bowen, et al.
Publicado: (2023)
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
por: Yasunaga, Michihiro, et al.
Publicado: (2025)
por: Yasunaga, Michihiro, et al.
Publicado: (2025)
Large Language Models on Graphs: A Comprehensive Survey
por: Jin, Bowen, et al.
Publicado: (2023)
por: Jin, Bowen, et al.
Publicado: (2023)
Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
por: Hu, Yushi, et al.
Publicado: (2025)
por: Hu, Yushi, et al.
Publicado: (2025)
LMFusion: Adapting Pretrained Language Models for Multimodal Generation
por: Shi, Weijia, et al.
Publicado: (2024)
por: Shi, Weijia, et al.
Publicado: (2024)
MYTE: Morphology-Driven Byte Encoding for Better and Fairer Multilingual Language Modeling
por: Limisiewicz, Tomasz, et al.
Publicado: (2024)
por: Limisiewicz, Tomasz, et al.
Publicado: (2024)
Slicing and Dicing: Configuring Optimal Mixtures of Experts
por: Li, Margaret, et al.
Publicado: (2026)
por: Li, Margaret, et al.
Publicado: (2026)
TV2TV: A Unified Framework for Interleaved Language and Video Generation
por: Han, Xiaochuang, et al.
Publicado: (2025)
por: Han, Xiaochuang, et al.
Publicado: (2025)
Evaluating Copyright Takedown Methods for Language Models
por: Wei, Boyi, et al.
Publicado: (2024)
por: Wei, Boyi, et al.
Publicado: (2024)
Soft Prompt Tuning for Augmenting Dense Retrieval with Large Language Models
por: Peng, Zhiyuan, et al.
Publicado: (2023)
por: Peng, Zhiyuan, et al.
Publicado: (2023)
Generative Adapter: Contextualizing Language Models in Parameters with A Single Forward Pass
por: Chen, Tong, et al.
Publicado: (2024)
por: Chen, Tong, et al.
Publicado: (2024)
(Mis)Fitting: A Survey of Scaling Laws
por: Li, Margaret, et al.
Publicado: (2025)
por: Li, Margaret, et al.
Publicado: (2025)
Graph Chain-of-Thought: Augmenting Large Language Models by Reasoning on Graphs
por: Jin, Bowen, et al.
Publicado: (2024)
por: Jin, Bowen, et al.
Publicado: (2024)
David helps Goliath: Inference-Time Collaboration Between Small Specialized and Large General Diffusion LMs
por: Han, Xiaochuang, et al.
Publicado: (2023)
por: Han, Xiaochuang, et al.
Publicado: (2023)
Reliable, Adaptable, and Attributable Language Models with Retrieval
por: Asai, Akari, et al.
Publicado: (2024)
por: Asai, Akari, et al.
Publicado: (2024)
Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations
por: Chen, Tong, et al.
Publicado: (2025)
por: Chen, Tong, et al.
Publicado: (2025)
SILO Language Models: Isolating Legal Risk In a Nonparametric Datastore
por: Min, Sewon, et al.
Publicado: (2023)
por: Min, Sewon, et al.
Publicado: (2023)
Recycling the Web: A Method to Enhance Pre-training Data Quality and Quantity for Language Models
por: Nguyen, Thao, et al.
Publicado: (2025)
por: Nguyen, Thao, et al.
Publicado: (2025)
Detecting Pretraining Data from Large Language Models
por: Shi, Weijia, et al.
Publicado: (2023)
por: Shi, Weijia, et al.
Publicado: (2023)
MiniDisc: Minimal Distillation Schedule for Language Model Compression
por: Zhang, Chen, et al.
Publicado: (2022)
por: Zhang, Chen, et al.
Publicado: (2022)
SELF: Self-Extend the Context Length With Logistic Growth Function
por: Dang, Phat Thanh, et al.
Publicado: (2025)
por: Dang, Phat Thanh, et al.
Publicado: (2025)
CopyBench: Measuring Literal and Non-Literal Reproduction of Copyright-Protected Text in Language Model Generation
por: Chen, Tong, et al.
Publicado: (2024)
por: Chen, Tong, et al.
Publicado: (2024)
Generating Synthetic Free-text Medical Records with Low Re-identification Risk using Masked Language Modeling
por: Belkadi, Samuel, et al.
Publicado: (2024)
por: Belkadi, Samuel, et al.
Publicado: (2024)
Q-PEFT: Query-dependent Parameter Efficient Fine-tuning for Text Reranking with Large Language Models
por: Peng, Zhiyuan, et al.
Publicado: (2024)
por: Peng, Zhiyuan, et al.
Publicado: (2024)
PocketLLM: Ultimate Compression of Large Language Models via Meta Networks
por: Tian, Ye, et al.
Publicado: (2025)
por: Tian, Ye, et al.
Publicado: (2025)
Demystifying Hybrid Thinking: Can LLMs Truly Switch Between Think and No-Think?
por: Wang, Shouren, et al.
Publicado: (2025)
por: Wang, Shouren, et al.
Publicado: (2025)
ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
por: Chen, Tong, et al.
Publicado: (2025)
por: Chen, Tong, et al.
Publicado: (2025)
Masked Diffusion Models are Secretly Time-Agnostic Masked Models and Exploit Inaccurate Categorical Sampling
por: Zheng, Kaiwen, et al.
Publicado: (2024)
por: Zheng, Kaiwen, et al.
Publicado: (2024)
Fast Byte Latent Transformer
por: Kallini, Julie, et al.
Publicado: (2026)
por: Kallini, Julie, et al.
Publicado: (2026)
MaskLLM: Learnable Semi-Structured Sparsity for Large Language Models
por: Fang, Gongfan, et al.
Publicado: (2024)
por: Fang, Gongfan, et al.
Publicado: (2024)
LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models
por: Han, Chi, et al.
Publicado: (2023)
por: Han, Chi, et al.
Publicado: (2023)
Direct Multi-Turn Preference Optimization for Language Agents
por: Shi, Wentao, et al.
Publicado: (2024)
por: Shi, Wentao, et al.
Publicado: (2024)
Faithfulness Measurable Masked Language Models
por: Madsen, Andreas, et al.
Publicado: (2023)
por: Madsen, Andreas, et al.
Publicado: (2023)
Boosting Large Language Models with Mask Fine-Tuning
por: Zhang, Mingyuan, et al.
Publicado: (2025)
por: Zhang, Mingyuan, et al.
Publicado: (2025)
Debiasing Large Language Models toward Social Factors in Online Behavior Analytics through Prompt Knowledge Tuning
por: Salemi, Hossein, et al.
Publicado: (2026)
por: Salemi, Hossein, et al.
Publicado: (2026)
Feature Alignment and Representation Transfer in Knowledge Distillation for Large Language Models
por: Yang, Junjie, et al.
Publicado: (2025)
por: Yang, Junjie, et al.
Publicado: (2025)
Beyond Masks: Efficient, Flexible Diffusion Language Models via Deletion-Insertion Processes
por: Ding, Fangyu, et al.
Publicado: (2026)
por: Ding, Fangyu, et al.
Publicado: (2026)
Large Language Model-driven Meta-structure Discovery in Heterogeneous Information Network
por: Chen, Lin, et al.
Publicado: (2024)
por: Chen, Lin, et al.
Publicado: (2024)
Ejemplares similares
-
ALMA: Alignment with Minimal Annotation
por: Yasunaga, Michihiro, et al.
Publicado: (2024) -
JPEG-LM: LLMs as Image Generators with Canonical Codec Representations
por: Han, Xiaochuang, et al.
Publicado: (2024) -
Learning Multiplex Representations on Text-Attributed Graphs with One Language Model Encoder
por: Jin, Bowen, et al.
Publicado: (2023) -
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
por: Yasunaga, Michihiro, et al.
Publicado: (2025) -
Large Language Models on Graphs: A Comprehensive Survey
por: Jin, Bowen, et al.
Publicado: (2023)