Seamless Deception: Larger Language Models Are Better Knowledge Concealers
Fuente:
arXiv
Salvato in:
| Autori principali: | Ashok, Dhananjay, Armstrong, Ruth-Ann, May, Jonathan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Language Models Can Predict Their Own Behavior
di: Ashok, Dhananjay, et al.
Pubblicazione: (2025)
di: Ashok, Dhananjay, et al.
Pubblicazione: (2025)
A Little Human Data Goes A Long Way
di: Ashok, Dhananjay, et al.
Pubblicazione: (2024)
di: Ashok, Dhananjay, et al.
Pubblicazione: (2024)
Controllable Text Generation in the Instruction-Tuning Era
di: Ashok, Dhananjay, et al.
Pubblicazione: (2024)
di: Ashok, Dhananjay, et al.
Pubblicazione: (2024)
Can VLMs Recall Factual Associations From Visual References?
di: Ashok, Dhananjay, et al.
Pubblicazione: (2025)
di: Ashok, Dhananjay, et al.
Pubblicazione: (2025)
Scaling Laws with Vocabulary: Larger Models Deserve Larger Vocabularies
di: Tao, Chaofan, et al.
Pubblicazione: (2024)
di: Tao, Chaofan, et al.
Pubblicazione: (2024)
Self-supervised Quantized Representation for Seamlessly Integrating Knowledge Graphs with Large Language Models
di: Lin, Qika, et al.
Pubblicazione: (2025)
di: Lin, Qika, et al.
Pubblicazione: (2025)
To Tell The Truth: Language of Deception and Language Models
di: Hazra, Sanchaita, et al.
Pubblicazione: (2023)
di: Hazra, Sanchaita, et al.
Pubblicazione: (2023)
Small Language Models Fine-tuned to Coordinate Larger Language Models improve Complex Reasoning
di: Juneja, Gurusha, et al.
Pubblicazione: (2023)
di: Juneja, Gurusha, et al.
Pubblicazione: (2023)
Bayesian Network Fusion of Large Language Models for Sentiment Analysis
di: Amirzadeh, Rasoul, et al.
Pubblicazione: (2025)
di: Amirzadeh, Rasoul, et al.
Pubblicazione: (2025)
Supervised Knowledge Makes Large Language Models Better In-context Learners
di: Yang, Linyi, et al.
Pubblicazione: (2023)
di: Yang, Linyi, et al.
Pubblicazione: (2023)
Exploring the Knowledge Mismatch Hypothesis: Hallucination Propensity in Small Models Fine-tuned on Data from Larger Models
di: Wee, Phil, et al.
Pubblicazione: (2024)
di: Wee, Phil, et al.
Pubblicazione: (2024)
Surprising Efficacy of Fine-Tuned Transformers for Fact-Checking over Larger Language Models
di: Setty, Vinay
Pubblicazione: (2024)
di: Setty, Vinay
Pubblicazione: (2024)
An Assessment of Model-On-Model Deception
di: Heitkoetter, Julius, et al.
Pubblicazione: (2024)
di: Heitkoetter, Julius, et al.
Pubblicazione: (2024)
Why Larger Language Models Do In-context Learning Differently?
di: Shi, Zhenmei, et al.
Pubblicazione: (2024)
di: Shi, Zhenmei, et al.
Pubblicazione: (2024)
Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones?
di: Zhang, Yudi, et al.
Pubblicazione: (2025)
di: Zhang, Yudi, et al.
Pubblicazione: (2025)
Instruction-tuned Language Models are Better Knowledge Learners
di: Jiang, Zhengbao, et al.
Pubblicazione: (2024)
di: Jiang, Zhengbao, et al.
Pubblicazione: (2024)
The Larger the Better? Improved LLM Code-Generation via Budget Reallocation
di: Hassid, Michael, et al.
Pubblicazione: (2024)
di: Hassid, Michael, et al.
Pubblicazione: (2024)
The Point of No Return: Counterfactual Localization of Deceptive Commitment in Language-Model Reasoning
di: Merrill, Scott, et al.
Pubblicazione: (2026)
di: Merrill, Scott, et al.
Pubblicazione: (2026)
Deceptive Automated Interpretability: Language Models Coordinating to Fool Oversight Systems
di: Lermen, Simon, et al.
Pubblicazione: (2025)
di: Lermen, Simon, et al.
Pubblicazione: (2025)
Unmasking the Shadows of AI: Investigating Deceptive Capabilities in Large Language Models
di: Guo, Linge
Pubblicazione: (2024)
di: Guo, Linge
Pubblicazione: (2024)
Two Heads Are Better Than One: Integrating Knowledge from Knowledge Graphs and Large Language Models for Entity Alignment
di: Yang, Linyao, et al.
Pubblicazione: (2024)
di: Yang, Linyao, et al.
Pubblicazione: (2024)
Deception Abilities Emerged in Large Language Models
di: Hagendorff, Thilo
Pubblicazione: (2023)
di: Hagendorff, Thilo
Pubblicazione: (2023)
Compromising Honesty and Harmlessness in Language Models via Deception Attacks
di: Vaugrante, Laurène, et al.
Pubblicazione: (2025)
di: Vaugrante, Laurène, et al.
Pubblicazione: (2025)
From Deception to Detection: The Dual Roles of Large Language Models in Fake News
di: Sallami, Dorsaf, et al.
Pubblicazione: (2024)
di: Sallami, Dorsaf, et al.
Pubblicazione: (2024)
Larger Language Models Don't Care How You Think: Why Chain-of-Thought Prompting Fails in Subjective Tasks
di: Chochlakis, Georgios, et al.
Pubblicazione: (2024)
di: Chochlakis, Georgios, et al.
Pubblicazione: (2024)
LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models
di: Olson, Matthew Lyle, et al.
Pubblicazione: (2026)
di: Olson, Matthew Lyle, et al.
Pubblicazione: (2026)
Too Big to Fool: Resisting Deception in Language Models
di: Samsami, Mohammad Reza, et al.
Pubblicazione: (2024)
di: Samsami, Mohammad Reza, et al.
Pubblicazione: (2024)
The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models
di: Chen, Yanjun, et al.
Pubblicazione: (2024)
di: Chen, Yanjun, et al.
Pubblicazione: (2024)
Unmasking Deceptive Visuals: Benchmarking Multimodal Large Language Models on Misleading Chart Question Answering
di: Chen, Zixin, et al.
Pubblicazione: (2025)
di: Chen, Zixin, et al.
Pubblicazione: (2025)
Teaching Language Models To Gather Information Proactively
di: Huang, Tenghao, et al.
Pubblicazione: (2025)
di: Huang, Tenghao, et al.
Pubblicazione: (2025)
Synthetic Feature Augmentation Improves Generalization Performance of Language Models
di: Choudhary, Ashok, et al.
Pubblicazione: (2025)
di: Choudhary, Ashok, et al.
Pubblicazione: (2025)
Exploitation Without Deception: Dark Triad Feature Steering Reveals Separable Antisocial Circuits in Language Models
di: Berg, Cameron, et al.
Pubblicazione: (2026)
di: Berg, Cameron, et al.
Pubblicazione: (2026)
Timo: Towards Better Temporal Reasoning for Language Models
di: Su, Zhaochen, et al.
Pubblicazione: (2024)
di: Su, Zhaochen, et al.
Pubblicazione: (2024)
Abstraction-of-Thought Makes Language Models Better Reasoners
di: Hong, Ruixin, et al.
Pubblicazione: (2024)
di: Hong, Ruixin, et al.
Pubblicazione: (2024)
PlaSma: Making Small Language Models Better Procedural Knowledge Models for (Counterfactual) Planning
di: Brahman, Faeze, et al.
Pubblicazione: (2023)
di: Brahman, Faeze, et al.
Pubblicazione: (2023)
OpenDeception: Learning Deception and Trust in Human-AI Interaction via Multi-Agent Simulation
di: Wu, Yichen, et al.
Pubblicazione: (2025)
di: Wu, Yichen, et al.
Pubblicazione: (2025)
Don't Believe Everything You Read: Enhancing Summarization Interpretability through Automatic Identification of Hallucinations in Large Language Models
di: Vakharia, Priyesh, et al.
Pubblicazione: (2023)
di: Vakharia, Priyesh, et al.
Pubblicazione: (2023)
Learning to Self-Verify Makes Language Models Better Reasoners
di: Chen, Yuxin, et al.
Pubblicazione: (2026)
di: Chen, Yuxin, et al.
Pubblicazione: (2026)
CausalEval: Towards Better Causal Reasoning in Language Models
di: Yu, Longxuan, et al.
Pubblicazione: (2024)
di: Yu, Longxuan, et al.
Pubblicazione: (2024)
Mixed Distillation Helps Smaller Language Model Better Reasoning
di: Li, Chenglin, et al.
Pubblicazione: (2023)
di: Li, Chenglin, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Language Models Can Predict Their Own Behavior
di: Ashok, Dhananjay, et al.
Pubblicazione: (2025) -
A Little Human Data Goes A Long Way
di: Ashok, Dhananjay, et al.
Pubblicazione: (2024) -
Controllable Text Generation in the Instruction-Tuning Era
di: Ashok, Dhananjay, et al.
Pubblicazione: (2024) -
Can VLMs Recall Factual Associations From Visual References?
di: Ashok, Dhananjay, et al.
Pubblicazione: (2025) -
Scaling Laws with Vocabulary: Larger Models Deserve Larger Vocabularies
di: Tao, Chaofan, et al.
Pubblicazione: (2024)