Layer-wise Regularized Dropout for Neural Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Ni, Shiwen, Yang, Min, Xu, Ruifeng, Li, Chengming, Hu, Xiping |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Training on the Benchmark Is Not All You Need
por: Ni, Shiwen, et al.
Publicado: (2024)
por: Ni, Shiwen, et al.
Publicado: (2024)
MoZIP: A Multilingual Benchmark to Evaluate Large Language Models in Intellectual Property
por: Ni, Shiwen, et al.
Publicado: (2024)
por: Ni, Shiwen, et al.
Publicado: (2024)
Forgetting before Learning: Utilizing Parametric Arithmetic for Knowledge Updating in Large Language Models
por: Ni, Shiwen, et al.
Publicado: (2023)
por: Ni, Shiwen, et al.
Publicado: (2023)
Learning to Generalize Unseen Domains via Multi-Source Meta Learning for Text Classification
por: Hu, Yuxuan, et al.
Publicado: (2024)
por: Hu, Yuxuan, et al.
Publicado: (2024)
Small Language Model as Data Prospector for Large Language Model
por: Ni, Shiwen, et al.
Publicado: (2024)
por: Ni, Shiwen, et al.
Publicado: (2024)
APTNESS: Incorporating Appraisal Theory and Emotion Support Strategies for Empathetic Response Generation
por: Hu, Yuxuan, et al.
Publicado: (2024)
por: Hu, Yuxuan, et al.
Publicado: (2024)
NUMCoT: Numerals and Units of Measurement in Chain-of-Thought Reasoning using Large Language Models
por: Xu, Ancheng, et al.
Publicado: (2024)
por: Xu, Ancheng, et al.
Publicado: (2024)
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
por: Liu, Ziqiang, et al.
Publicado: (2024)
por: Liu, Ziqiang, et al.
Publicado: (2024)
E-EVAL: A Comprehensive Chinese K-12 Education Evaluation Benchmark for Large Language Models
por: Hou, Jinchang, et al.
Publicado: (2024)
por: Hou, Jinchang, et al.
Publicado: (2024)
Layer-wise Positional Bias in Short-Context Language Modeling
por: Rahimi, Maryam, et al.
Publicado: (2026)
por: Rahimi, Maryam, et al.
Publicado: (2026)
Probing the Difficulty Perception Mechanism of Large Language Models
por: Lee, Sunbowen, et al.
Publicado: (2025)
por: Lee, Sunbowen, et al.
Publicado: (2025)
CPsyCoun: A Report-based Multi-turn Dialogue Reconstruction and Evaluation Framework for Chinese Psychological Counseling
por: Zhang, Chenhao, et al.
Publicado: (2024)
por: Zhang, Chenhao, et al.
Publicado: (2024)
Lower Layers Matter: Alleviating Hallucination via Multi-Layer Fusion Contrastive Decoding with Truthfulness Refocused
por: Chen, Dingwei, et al.
Publicado: (2024)
por: Chen, Dingwei, et al.
Publicado: (2024)
AgentCourt: Simulating Court with Adversarial Evolvable Lawyer Agents
por: Chen, Guhong, et al.
Publicado: (2024)
por: Chen, Guhong, et al.
Publicado: (2024)
Improve Decoding Factuality by Token-wise Cross Layer Entropy of Large Language Models
por: Wu, Jialiang, et al.
Publicado: (2025)
por: Wu, Jialiang, et al.
Publicado: (2025)
Drop Dropout on Single-Epoch Language Model Pretraining
por: Liu, Houjun, et al.
Publicado: (2025)
por: Liu, Houjun, et al.
Publicado: (2025)
IPBench: Benchmarking the Knowledge of Large Language Models in Intellectual Property
por: Wang, Qiyao, et al.
Publicado: (2025)
por: Wang, Qiyao, et al.
Publicado: (2025)
SEM: Reinforcement Learning for Search-Efficient Large Language Models
por: Sha, Zeyang, et al.
Publicado: (2025)
por: Sha, Zeyang, et al.
Publicado: (2025)
LRP4RAG: Detecting Hallucinations in Retrieval-Augmented Generation via Layer-wise Relevance Propagation
por: Hu, Haichuan, et al.
Publicado: (2024)
por: Hu, Haichuan, et al.
Publicado: (2024)
TernaryLM: Memory-Efficient Language Modeling via Native 1.5-Bit Quantization with Adaptive Layer-wise Scaling
por: Nargund, Nisharg, et al.
Publicado: (2026)
por: Nargund, Nisharg, et al.
Publicado: (2026)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
por: Tang, Zicong, et al.
Publicado: (2025)
por: Tang, Zicong, et al.
Publicado: (2025)
Unsupervised Layer-wise Score Aggregation for Textual OOD Detection
por: Darrin, Maxime, et al.
Publicado: (2023)
por: Darrin, Maxime, et al.
Publicado: (2023)
Enhancing Noise Robustness of Retrieval-Augmented Language Models with Adaptive Adversarial Training
por: Fang, Feiteng, et al.
Publicado: (2024)
por: Fang, Feiteng, et al.
Publicado: (2024)
LAET: A Layer-wise Adaptive Ensemble Tuning Framework for Pretrained Language Models
por: Ahad, Jawad Ibn, et al.
Publicado: (2025)
por: Ahad, Jawad Ibn, et al.
Publicado: (2025)
Unlabeled Debiasing in Downstream Tasks via Class-wise Low Variance Regularization
por: Masoudian, Shahed, et al.
Publicado: (2024)
por: Masoudian, Shahed, et al.
Publicado: (2024)
Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution
por: Dineen, Jacob, et al.
Publicado: (2026)
por: Dineen, Jacob, et al.
Publicado: (2026)
Personalized Large Language Model Assistant with Evolving Conditional Memory
por: Yuan, Ruifeng, et al.
Publicado: (2023)
por: Yuan, Ruifeng, et al.
Publicado: (2023)
Neural Diversity Regularizes Hallucinations in Language Models
por: Chakrabarti, Kushal, et al.
Publicado: (2025)
por: Chakrabarti, Kushal, et al.
Publicado: (2025)
Efficient Layer-wise LLM Fine-tuning for Revision Intention Prediction
por: Liu, Zhexiong, et al.
Publicado: (2025)
por: Liu, Zhexiong, et al.
Publicado: (2025)
DepWiGNN: A Depth-wise Graph Neural Network for Multi-hop Spatial Reasoning in Text
por: Li, Shuaiyi, et al.
Publicado: (2023)
por: Li, Shuaiyi, et al.
Publicado: (2023)
SOD: Step-wise On-policy Distillation for Small Language Model Agents
por: Zhong, Qiyong, et al.
Publicado: (2026)
por: Zhong, Qiyong, et al.
Publicado: (2026)
Mechanistic Steering of LLMs Reveals Layer-wise Feature Vulnerabilities in Adversarial Settings
por: Das, Nilanjana, et al.
Publicado: (2026)
por: Das, Nilanjana, et al.
Publicado: (2026)
SpecBound: Adaptive Bounded Self-Speculation with Layer-wise Confidence Calibration
por: Wen, Zhuofan, et al.
Publicado: (2026)
por: Wen, Zhuofan, et al.
Publicado: (2026)
DESTEIN: Navigating Detoxification of Language Models via Universal Steering Pairs and Head-wise Activation Fusion
por: Li, Yu, et al.
Publicado: (2024)
por: Li, Yu, et al.
Publicado: (2024)
Towards Inference-time Category-wise Safety Steering for Large Language Models
por: Bhattacharjee, Amrita, et al.
Publicado: (2024)
por: Bhattacharjee, Amrita, et al.
Publicado: (2024)
Hallucination Detox: Sensitivity Dropout (SenD) for Large Language Model Training
por: Mohammadzadeh, Shahrad, et al.
Publicado: (2024)
por: Mohammadzadeh, Shahrad, et al.
Publicado: (2024)
AuthorMix: Modular Authorship Style Transfer via Layer-wise Adapter Mixing
por: Thillainathan, Sarubi, et al.
Publicado: (2026)
por: Thillainathan, Sarubi, et al.
Publicado: (2026)
Continual Learning with Embedding Layer Surgery and Task-wise Beam Search using Whisper
por: Kwok, Chin Yuen, et al.
Publicado: (2025)
por: Kwok, Chin Yuen, et al.
Publicado: (2025)
EPI-SQL: Enhancing Text-to-SQL Translation with Error-Prevention Instructions
por: Liu, Xiping, et al.
Publicado: (2024)
por: Liu, Xiping, et al.
Publicado: (2024)
Optimal Transport Regularization for Speech Text Alignment in Spoken Language Models
por: Xu, Wenze, et al.
Publicado: (2025)
por: Xu, Wenze, et al.
Publicado: (2025)
Ejemplares similares
-
Training on the Benchmark Is Not All You Need
por: Ni, Shiwen, et al.
Publicado: (2024) -
MoZIP: A Multilingual Benchmark to Evaluate Large Language Models in Intellectual Property
por: Ni, Shiwen, et al.
Publicado: (2024) -
Forgetting before Learning: Utilizing Parametric Arithmetic for Knowledge Updating in Large Language Models
por: Ni, Shiwen, et al.
Publicado: (2023) -
Learning to Generalize Unseen Domains via Multi-Source Meta Learning for Text Classification
por: Hu, Yuxuan, et al.
Publicado: (2024) -
Small Language Model as Data Prospector for Large Language Model
por: Ni, Shiwen, et al.
Publicado: (2024)