Self-Recognition in Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Davidson, Tim R., Surkov, Viacheslav, Veselovsky, Veniamin, Russo, Giuseppe, West, Robert, Gulcehre, Caglar |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Evaluating Language Model Agency through Negotiations
di: Davidson, Tim R., et al.
Pubblicazione: (2024)
di: Davidson, Tim R., et al.
Pubblicazione: (2024)
One-Step is Enough: Sparse Autoencoders for Text-to-Image Diffusion Models
di: Surkov, Viacheslav, et al.
Pubblicazione: (2024)
di: Surkov, Viacheslav, et al.
Pubblicazione: (2024)
Fleet of Agents: Coordinated Problem Solving with Large Language Models
di: Klein, Lars, et al.
Pubblicazione: (2024)
di: Klein, Lars, et al.
Pubblicazione: (2024)
Identifying and Mitigating the Influence of the Prior Distribution in Large Language Models
di: Zhang, Liyi, et al.
Pubblicazione: (2025)
di: Zhang, Liyi, et al.
Pubblicazione: (2025)
Separating Tongue from Thought: Activation Patching Reveals Language-Agnostic Concept Representations in Transformers
di: Dumas, Clément, et al.
Pubblicazione: (2024)
di: Dumas, Clément, et al.
Pubblicazione: (2024)
Promises, Outlooks and Challenges of Diffusion Language Modeling
di: Deschenaux, Justin, et al.
Pubblicazione: (2024)
di: Deschenaux, Justin, et al.
Pubblicazione: (2024)
What is a Number, That a Large Language Model May Know It?
di: Marjieh, Raja, et al.
Pubblicazione: (2025)
di: Marjieh, Raja, et al.
Pubblicazione: (2025)
Beyond Autoregression: Fast LLMs via Self-Distillation Through Time
di: Deschenaux, Justin, et al.
Pubblicazione: (2024)
di: Deschenaux, Justin, et al.
Pubblicazione: (2024)
Localized Cultural Knowledge is Conserved and Controllable in Large Language Models
di: Veselovsky, Veniamin, et al.
Pubblicazione: (2025)
di: Veselovsky, Veniamin, et al.
Pubblicazione: (2025)
In Search for Architectures and Loss Functions in Multi-Objective Reinforcement Learning
di: Terekhov, Mikhail, et al.
Pubblicazione: (2024)
di: Terekhov, Mikhail, et al.
Pubblicazione: (2024)
Do Llamas Work in English? On the Latent Language of Multilingual Transformers
di: Wendler, Chris, et al.
Pubblicazione: (2024)
di: Wendler, Chris, et al.
Pubblicazione: (2024)
The Role of Deep Learning Regularizations on Actors in Offline RL
di: Tarasov, Denis, et al.
Pubblicazione: (2024)
di: Tarasov, Denis, et al.
Pubblicazione: (2024)
Reasoning-Driven Synthetic Data Generation and Evaluation
di: Davidson, Tim R., et al.
Pubblicazione: (2026)
di: Davidson, Tim R., et al.
Pubblicazione: (2026)
Getting Serious about Humor: Crafting Humor Datasets with Unfunny Large Language Models
di: Horvitz, Zachary, et al.
Pubblicazione: (2024)
di: Horvitz, Zachary, et al.
Pubblicazione: (2024)
Self-Debiasing Large Language Models: Zero-Shot Recognition and Reduction of Stereotypes
di: Gallegos, Isabel O., et al.
Pubblicazione: (2024)
di: Gallegos, Isabel O., et al.
Pubblicazione: (2024)
A Glitch in the Matrix? Locating and Detecting Language Model Grounding with Fakepedia
di: Monea, Giovanni, et al.
Pubblicazione: (2023)
di: Monea, Giovanni, et al.
Pubblicazione: (2023)
Your Finetuned Large Language Model is Already a Powerful Out-of-distribution Detector
di: Zhang, Andi, et al.
Pubblicazione: (2024)
di: Zhang, Andi, et al.
Pubblicazione: (2024)
The AI Review Lottery: Widespread AI-Assisted Peer Reviews Boost Paper Scores and Acceptance Rates
di: Latona, Giuseppe Russo, et al.
Pubblicazione: (2024)
di: Latona, Giuseppe Russo, et al.
Pubblicazione: (2024)
Large Language Models Are Overparameterized Text Encoders
di: K, Thennal D, et al.
Pubblicazione: (2024)
di: K, Thennal D, et al.
Pubblicazione: (2024)
Grammar-Constrained Decoding for Structured NLP Tasks without Finetuning
di: Geng, Saibo, et al.
Pubblicazione: (2023)
di: Geng, Saibo, et al.
Pubblicazione: (2023)
SelfIE: Self-Interpretation of Large Language Model Embeddings
di: Chen, Haozhe, et al.
Pubblicazione: (2024)
di: Chen, Haozhe, et al.
Pubblicazione: (2024)
Explorations of Self-Repair in Language Models
di: Rushing, Cody, et al.
Pubblicazione: (2024)
di: Rushing, Cody, et al.
Pubblicazione: (2024)
Better Estimation of the Kullback--Leibler Divergence Between Language Models
di: Amini, Afra, et al.
Pubblicazione: (2025)
di: Amini, Afra, et al.
Pubblicazione: (2025)
Syntactic Control of Language Models by Posterior Inference
di: Xefteri, Vicky, et al.
Pubblicazione: (2025)
di: Xefteri, Vicky, et al.
Pubblicazione: (2025)
Towards More Effective Table-to-Text Generation: Assessing In-Context Learning and Self-Evaluation with Open-Source Models
di: Iravani, Sahar, et al.
Pubblicazione: (2024)
di: Iravani, Sahar, et al.
Pubblicazione: (2024)
Self-Improvement in Language Models: The Sharpening Mechanism
di: Huang, Audrey, et al.
Pubblicazione: (2024)
di: Huang, Audrey, et al.
Pubblicazione: (2024)
Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
di: Chen, Zixiang, et al.
Pubblicazione: (2024)
di: Chen, Zixiang, et al.
Pubblicazione: (2024)
Self-Generated Critiques Boost Reward Modeling for Language Models
di: Yu, Yue, et al.
Pubblicazione: (2024)
di: Yu, Yue, et al.
Pubblicazione: (2024)
SelfCite: Self-Supervised Alignment for Context Attribution in Large Language Models
di: Chuang, Yung-Sung, et al.
Pubblicazione: (2025)
di: Chuang, Yung-Sung, et al.
Pubblicazione: (2025)
Large Language Models Struggle in Token-Level Clinical Named Entity Recognition
di: Lu, Qiuhao, et al.
Pubblicazione: (2024)
di: Lu, Qiuhao, et al.
Pubblicazione: (2024)
Soft Self-Consistency Improves Language Model Agents
di: Wang, Han, et al.
Pubblicazione: (2024)
di: Wang, Han, et al.
Pubblicazione: (2024)
Self-Play Preference Optimization for Language Model Alignment
di: Wu, Yue, et al.
Pubblicazione: (2024)
di: Wu, Yue, et al.
Pubblicazione: (2024)
Large Language Models can be Strong Self-Detoxifiers
di: Ko, Ching-Yun, et al.
Pubblicazione: (2024)
di: Ko, Ching-Yun, et al.
Pubblicazione: (2024)
Aligning Large Language Models by On-Policy Self-Judgment
di: Lee, Sangkyu, et al.
Pubblicazione: (2024)
di: Lee, Sangkyu, et al.
Pubblicazione: (2024)
Latent Principle Discovery for Language Model Self-Improvement
di: Ramji, Keshav, et al.
Pubblicazione: (2025)
di: Ramji, Keshav, et al.
Pubblicazione: (2025)
Self-Evolving Critique Abilities in Large Language Models
di: Tang, Zhengyang, et al.
Pubblicazione: (2025)
di: Tang, Zhengyang, et al.
Pubblicazione: (2025)
Self-Hinting Language Models Enhance Reinforcement Learning
di: Liao, Baohao, et al.
Pubblicazione: (2026)
di: Liao, Baohao, et al.
Pubblicazione: (2026)
Disentangling Exploration of Large Language Models by Optimal Exploitation
di: Grams, Tim, et al.
Pubblicazione: (2025)
di: Grams, Tim, et al.
Pubblicazione: (2025)
GRAD: Generative Retrieval-Aligned Demonstration Sampler for Efficient Few-Shot Reasoning
di: Gabouj, Oussama, et al.
Pubblicazione: (2025)
di: Gabouj, Oussama, et al.
Pubblicazione: (2025)
When Correct Isn't Usable: Improving Structured Output Reliability in Small Language Models
di: Galeone, Cosimo, et al.
Pubblicazione: (2026)
di: Galeone, Cosimo, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Evaluating Language Model Agency through Negotiations
di: Davidson, Tim R., et al.
Pubblicazione: (2024) -
One-Step is Enough: Sparse Autoencoders for Text-to-Image Diffusion Models
di: Surkov, Viacheslav, et al.
Pubblicazione: (2024) -
Fleet of Agents: Coordinated Problem Solving with Large Language Models
di: Klein, Lars, et al.
Pubblicazione: (2024) -
Identifying and Mitigating the Influence of the Prior Distribution in Large Language Models
di: Zhang, Liyi, et al.
Pubblicazione: (2025) -
Separating Tongue from Thought: Activation Patching Reveals Language-Agnostic Concept Representations in Transformers
di: Dumas, Clément, et al.
Pubblicazione: (2024)