Purifying Large Language Models by Ensembling a Small Language Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Tianlin, Liu, Qian, Pang, Tianyu, Du, Chao, Guo, Qing, Liu, Yang, Lin, Min |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Your Large Language Model is Secretly a Fairness Proponent and You Should Prompt it Like One
di: Li, Tianlin, et al.
Pubblicazione: (2024)
di: Li, Tianlin, et al.
Pubblicazione: (2024)
The Readout Shortcut: Positional Number Copying Dominates Arithmetic CoT Readout in Small Language Models
di: Liu, Ming
Pubblicazione: (2026)
di: Liu, Ming
Pubblicazione: (2026)
HAMMER: Hamiltonian Curiosity Augmented Large Language Model Reinforcement
di: Yang, Ming, et al.
Pubblicazione: (2025)
di: Yang, Ming, et al.
Pubblicazione: (2025)
Consistency Evaluation of News Article Summaries Generated by Large (and Small) Language Models
di: Gilhuly, Colleen, et al.
Pubblicazione: (2025)
di: Gilhuly, Colleen, et al.
Pubblicazione: (2025)
Self-Supervised Position Debiasing for Large Language Models
di: Liu, Zhongkun, et al.
Pubblicazione: (2024)
di: Liu, Zhongkun, et al.
Pubblicazione: (2024)
R2R: Efficiently Navigating Divergent Reasoning Paths with Small-Large Model Token Routing
di: Fu, Tianyu, et al.
Pubblicazione: (2025)
di: Fu, Tianyu, et al.
Pubblicazione: (2025)
Random-Set Large Language Models
di: Mubashar, Muhammad, et al.
Pubblicazione: (2025)
di: Mubashar, Muhammad, et al.
Pubblicazione: (2025)
Danoliteracy of Generative Large Language Models
di: Holm, Søren Vejlgaard, et al.
Pubblicazione: (2024)
di: Holm, Søren Vejlgaard, et al.
Pubblicazione: (2024)
A Closer Look at Machine Unlearning for Large Language Models
di: Yuan, Xiaojian, et al.
Pubblicazione: (2024)
di: Yuan, Xiaojian, et al.
Pubblicazione: (2024)
PlanRAG: A Plan-then-Retrieval Augmented Generation for Generative Large Language Models as Decision Makers
di: Lee, Myeonghwa, et al.
Pubblicazione: (2024)
di: Lee, Myeonghwa, et al.
Pubblicazione: (2024)
When Attention Sink Emerges in Language Models: An Empirical View
di: Gu, Xiangming, et al.
Pubblicazione: (2024)
di: Gu, Xiangming, et al.
Pubblicazione: (2024)
ProSparse: Introducing and Enhancing Intrinsic Activation Sparsity within Large Language Models
di: Song, Chenyang, et al.
Pubblicazione: (2024)
di: Song, Chenyang, et al.
Pubblicazione: (2024)
RAVR: Reference-Answer-guided Variational Reasoning for Large Language Models
di: Lin, Tianqianjin, et al.
Pubblicazione: (2025)
di: Lin, Tianqianjin, et al.
Pubblicazione: (2025)
SWI: Speaking with Intent in Large Language Models
di: Yin, Yuwei, et al.
Pubblicazione: (2025)
di: Yin, Yuwei, et al.
Pubblicazione: (2025)
Large Language Models as Common-Sense Heuristics
di: Borro, Andrey, et al.
Pubblicazione: (2025)
di: Borro, Andrey, et al.
Pubblicazione: (2025)
Uncovering Biases with Reflective Large Language Models
di: Chang, Edward Y.
Pubblicazione: (2024)
di: Chang, Edward Y.
Pubblicazione: (2024)
Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models
di: Zhang, Gongbo, et al.
Pubblicazione: (2026)
di: Zhang, Gongbo, et al.
Pubblicazione: (2026)
RACE-Align: Retrieval-Augmented and Chain-of-Thought Enhanced Preference Alignment for Large Language Models
di: Yan, Qihang, et al.
Pubblicazione: (2025)
di: Yan, Qihang, et al.
Pubblicazione: (2025)
Scalable Token-Level Hallucination Detection in Large Language Models
di: Min, Rui, et al.
Pubblicazione: (2026)
di: Min, Rui, et al.
Pubblicazione: (2026)
Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses
di: Zheng, Xiaosen, et al.
Pubblicazione: (2024)
di: Zheng, Xiaosen, et al.
Pubblicazione: (2024)
Revisiting a Pain in the Neck: Semantic Phrase Processing Benchmark for Language Models
di: Liu, Yang, et al.
Pubblicazione: (2024)
di: Liu, Yang, et al.
Pubblicazione: (2024)
Benchmarking Cognitive Biases in Large Language Models as Evaluators
di: Koo, Ryan, et al.
Pubblicazione: (2023)
di: Koo, Ryan, et al.
Pubblicazione: (2023)
Cognitive Load Limits in Large Language Models: Benchmarking Multi-Hop Reasoning
di: Adapala, Sai Teja Reddy
Pubblicazione: (2025)
di: Adapala, Sai Teja Reddy
Pubblicazione: (2025)
Brain-Inspired Exploration of Functional Networks and Key Neurons in Large Language Models
di: Liu, Yiheng, et al.
Pubblicazione: (2025)
di: Liu, Yiheng, et al.
Pubblicazione: (2025)
Large Language Models are Pattern Matchers: Editing Semi-Structured and Structured Documents with ChatGPT
di: Weber, Irene
Pubblicazione: (2024)
di: Weber, Irene
Pubblicazione: (2024)
Painless Activation Steering: An Automated, Lightweight Approach for Post-Training Large Language Models
di: Cui, Sasha, et al.
Pubblicazione: (2025)
di: Cui, Sasha, et al.
Pubblicazione: (2025)
Graph Language Models
di: Plenz, Moritz, et al.
Pubblicazione: (2024)
di: Plenz, Moritz, et al.
Pubblicazione: (2024)
Identifying and Mitigating the Influence of the Prior Distribution in Large Language Models
di: Zhang, Liyi, et al.
Pubblicazione: (2025)
di: Zhang, Liyi, et al.
Pubblicazione: (2025)
Training Optimal Large Diffusion Language Models
di: Ni, Jinjie, et al.
Pubblicazione: (2025)
di: Ni, Jinjie, et al.
Pubblicazione: (2025)
Adaptive Activation Cancellation for Hallucination Mitigation in Large Language Models
di: Yocam, Eric, et al.
Pubblicazione: (2026)
di: Yocam, Eric, et al.
Pubblicazione: (2026)
Evaluating the Effectiveness of Large Language Models in Representing and Understanding Movement Trajectories
di: Ji, Yuhan, et al.
Pubblicazione: (2024)
di: Ji, Yuhan, et al.
Pubblicazione: (2024)
Beyond Hallucinations: A Composite Score for Measuring Reliability in Open-Source Large Language Models
di: Salla, Rohit Kumar, et al.
Pubblicazione: (2025)
di: Salla, Rohit Kumar, et al.
Pubblicazione: (2025)
Variational Reasoning for Language Models
di: Zhou, Xiangxin, et al.
Pubblicazione: (2025)
di: Zhou, Xiangxin, et al.
Pubblicazione: (2025)
Applied Explainability for Large Language Models: A Comparative Study
di: Kancharla, Venkata Abhinandan
Pubblicazione: (2026)
di: Kancharla, Venkata Abhinandan
Pubblicazione: (2026)
Alif: Advancing Urdu Large Language Models via Multilingual Synthetic Data Distillation
di: Shafique, Muhammad Ali, et al.
Pubblicazione: (2025)
di: Shafique, Muhammad Ali, et al.
Pubblicazione: (2025)
Large Language Model (LLM) Bias Index -- LLMBI
di: Oketunji, Abiodun Finbarrs, et al.
Pubblicazione: (2023)
di: Oketunji, Abiodun Finbarrs, et al.
Pubblicazione: (2023)
AgentTTS: Large Language Model Agent for Test-time Compute-optimal Scaling Strategy in Complex Tasks
di: Wang, Fali, et al.
Pubblicazione: (2025)
di: Wang, Fali, et al.
Pubblicazione: (2025)
Reinforced Language Models for Sequential Decision Making
di: Dilkes, Jim, et al.
Pubblicazione: (2025)
di: Dilkes, Jim, et al.
Pubblicazione: (2025)
Do Personality Traits Interfere? Geometric Limitations of Steering in Large Language Models
di: Bhandari, Pranav, et al.
Pubblicazione: (2026)
di: Bhandari, Pranav, et al.
Pubblicazione: (2026)
Detecting Hallucinations in Large Language Model Generation: A Token Probability Approach
di: Quevedo, Ernesto, et al.
Pubblicazione: (2024)
di: Quevedo, Ernesto, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Your Large Language Model is Secretly a Fairness Proponent and You Should Prompt it Like One
di: Li, Tianlin, et al.
Pubblicazione: (2024) -
The Readout Shortcut: Positional Number Copying Dominates Arithmetic CoT Readout in Small Language Models
di: Liu, Ming
Pubblicazione: (2026) -
HAMMER: Hamiltonian Curiosity Augmented Large Language Model Reinforcement
di: Yang, Ming, et al.
Pubblicazione: (2025) -
Consistency Evaluation of News Article Summaries Generated by Large (and Small) Language Models
di: Gilhuly, Colleen, et al.
Pubblicazione: (2025) -
Self-Supervised Position Debiasing for Large Language Models
di: Liu, Zhongkun, et al.
Pubblicazione: (2024)