Enregistré dans:
| Auteurs principaux: | Pfister, Jan, Wunderle, Julia, Hotho, Andreas |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2411.11171 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
New Encoders for German Trained from Scratch: Comparing ModernGBERT with Converted LLM2Vec Models
par: Wunderle, Julia, et autres
Publié: (2025)
par: Wunderle, Julia, et autres
Publié: (2025)
Ayn: A Tiny yet Competitive Indian Legal Language Model Pretrained from Scratch
par: Niyogi, Mitodru, et autres
Publié: (2024)
par: Niyogi, Mitodru, et autres
Publié: (2024)
BanglaLlama: LLaMA for Bangla Language
par: Zehady, Abdullah Khan, et autres
Publié: (2024)
par: Zehady, Abdullah Khan, et autres
Publié: (2024)
Compact Language Models via Pruning and Knowledge Distillation
par: Muralidharan, Saurav, et autres
Publié: (2024)
par: Muralidharan, Saurav, et autres
Publié: (2024)
LLaSA: Large Language and Structured Data Assistant
par: Xu, Yao, et autres
Publié: (2024)
par: Xu, Yao, et autres
Publié: (2024)
Inference-Time Intervention: Eliciting Truthful Answers from a Language Model
par: Li, Kenneth, et autres
Publié: (2023)
par: Li, Kenneth, et autres
Publié: (2023)
Higher-Order DeepTrails: Unified Approach to *Trails
par: Koopmann, Tobias, et autres
Publié: (2023)
par: Koopmann, Tobias, et autres
Publié: (2023)
Calibrating Large Language Models Using Their Generations Only
par: Ulmer, Dennis, et autres
Publié: (2024)
par: Ulmer, Dennis, et autres
Publié: (2024)
MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning
par: Zhang, Jianyi, et autres
Publié: (2024)
par: Zhang, Jianyi, et autres
Publié: (2024)
LLaDA2.0: Scaling Up Diffusion Language Models to 100B
par: Bie, Tiwei, et autres
Publié: (2025)
par: Bie, Tiwei, et autres
Publié: (2025)
Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning
par: Xia, Mengzhou, et autres
Publié: (2023)
par: Xia, Mengzhou, et autres
Publié: (2023)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
par: Zhang, Qingru, et autres
Publié: (2025)
par: Zhang, Qingru, et autres
Publié: (2025)
Comprehensive Study on German Language Models for Clinical and Biomedical Text Understanding
par: Idrissi-Yaghir, Ahmad, et autres
Publié: (2024)
par: Idrissi-Yaghir, Ahmad, et autres
Publié: (2024)
Measuring and Controlling Instruction (In)Stability in Language Model Dialogs
par: Li, Kenneth, et autres
Publié: (2024)
par: Li, Kenneth, et autres
Publié: (2024)
Distilling LLMs' Decomposition Abilities into Compact Language Models
par: Tarasov, Denis, et autres
Publié: (2024)
par: Tarasov, Denis, et autres
Publié: (2024)
EmbedLLM: Learning Compact Representations of Large Language Models
par: Zhuang, Richard, et autres
Publié: (2024)
par: Zhuang, Richard, et autres
Publié: (2024)
MAP-Neo: Highly Capable and Transparent Bilingual Large Language Model Series
par: Zhang, Ge, et autres
Publié: (2024)
par: Zhang, Ge, et autres
Publié: (2024)
CaLM: Contrasting Large and Small Language Models to Verify Grounded Generation
par: Hsu, I-Hung, et autres
Publié: (2024)
par: Hsu, I-Hung, et autres
Publié: (2024)
LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model
par: Sun, Yirong, et autres
Publié: (2025)
par: Sun, Yirong, et autres
Publié: (2025)
AMQ: Enabling AutoML for Mixed-precision Weight-Only Quantization of Large Language Models
par: Lee, Sangjun, et autres
Publié: (2025)
par: Lee, Sangjun, et autres
Publié: (2025)
CodecLM: Aligning Language Models with Tailored Synthetic Data
par: Wang, Zifeng, et autres
Publié: (2024)
par: Wang, Zifeng, et autres
Publié: (2024)
I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models
par: Hu, Xing, et autres
Publié: (2024)
par: Hu, Xing, et autres
Publié: (2024)
Lookback Lens: Detecting and Mitigating Contextual Hallucinations in Large Language Models Using Only Attention Maps
par: Chuang, Yung-Sung, et autres
Publié: (2024)
par: Chuang, Yung-Sung, et autres
Publié: (2024)
Predicting Compact Phrasal Rewrites with Large Language Models for ASR Post Editing
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
FBI-LLM: Scaling Up Fully Binarized LLMs from Scratch via Autoregressive Distillation
par: Ma, Liqun, et autres
Publié: (2024)
par: Ma, Liqun, et autres
Publié: (2024)
TableDreamer: Progressive and Weakness-guided Data Synthesis from Scratch for Table Instruction Tuning
par: Zheng, Mingyu, et autres
Publié: (2025)
par: Zheng, Mingyu, et autres
Publié: (2025)
Continuous Diffusion Scales Competitively with Discrete Diffusion for Language
par: Yang, Zhihan, et autres
Publié: (2026)
par: Yang, Zhihan, et autres
Publié: (2026)
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
par: Lan, Zhibin, et autres
Publié: (2025)
par: Lan, Zhibin, et autres
Publié: (2025)
Resa: Transparent Reasoning Models via SAEs
par: Wang, Shangshang, et autres
Publié: (2025)
par: Wang, Shangshang, et autres
Publié: (2025)
Competitive Programming with Large Reasoning Models
par: OpenAI, et autres
Publié: (2025)
par: OpenAI, et autres
Publié: (2025)
Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations
par: Wei, Zeming, et autres
Publié: (2023)
par: Wei, Zeming, et autres
Publié: (2023)
Tracing Facts or just Copies? A critical investigation of the Competitions of Mechanisms in Large Language Models
par: Campregher, Dante, et autres
Publié: (2025)
par: Campregher, Dante, et autres
Publié: (2025)
Never Start from Scratch: Expediting On-Device LLM Personalization via Explainable Model Selection
par: Wang, Haoming, et autres
Publié: (2025)
par: Wang, Haoming, et autres
Publié: (2025)
CosmicFish-HRM: Adaptive Reasoning via Hierarchical Recurrent Mechanisms in Compact Language Models
par: Lakkapragada, Venkat Akhil
Publié: (2026)
par: Lakkapragada, Venkat Akhil
Publié: (2026)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
par: Zeer, Ahmed, et autres
Publié: (2024)
par: Zeer, Ahmed, et autres
Publié: (2024)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
par: Sun, Guohao, et autres
Publié: (2024)
par: Sun, Guohao, et autres
Publié: (2024)
Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task
par: Li, Kenneth, et autres
Publié: (2022)
par: Li, Kenneth, et autres
Publié: (2022)
LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention
par: Zhang, Renrui, et autres
Publié: (2023)
par: Zhang, Renrui, et autres
Publié: (2023)
Eliciting Latent Knowledge from Quirky Language Models
par: Mallen, Alex, et autres
Publié: (2023)
par: Mallen, Alex, et autres
Publié: (2023)
Are self-explanations from Large Language Models faithful?
par: Madsen, Andreas, et autres
Publié: (2024)
par: Madsen, Andreas, et autres
Publié: (2024)
Documents similaires
-
New Encoders for German Trained from Scratch: Comparing ModernGBERT with Converted LLM2Vec Models
par: Wunderle, Julia, et autres
Publié: (2025) -
Ayn: A Tiny yet Competitive Indian Legal Language Model Pretrained from Scratch
par: Niyogi, Mitodru, et autres
Publié: (2024) -
BanglaLlama: LLaMA for Bangla Language
par: Zehady, Abdullah Khan, et autres
Publié: (2024) -
Compact Language Models via Pruning and Knowledge Distillation
par: Muralidharan, Saurav, et autres
Publié: (2024) -
LLaSA: Large Language and Structured Data Assistant
par: Xu, Yao, et autres
Publié: (2024)