SelfIE: Self-Interpretation of Large Language Model Embeddings
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Haozhe, Vondrick, Carl, Mao, Chengzhi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TeleTables: A Benchmark for Large Language Models in Telecom Table Interpretation
par: Ezzakri, Anas, et autres
Publié: (2025)
par: Ezzakri, Anas, et autres
Publié: (2025)
LLMCheckup: Conversational Examination of Large Language Models via Interpretability Tools and Self-Explanations
par: Wang, Qianli, et autres
Publié: (2024)
par: Wang, Qianli, et autres
Publié: (2024)
Large Language Models can be Strong Self-Detoxifiers
par: Ko, Ching-Yun, et autres
Publié: (2024)
par: Ko, Ching-Yun, et autres
Publié: (2024)
SelfCite: Self-Supervised Alignment for Context Attribution in Large Language Models
par: Chuang, Yung-Sung, et autres
Publié: (2025)
par: Chuang, Yung-Sung, et autres
Publié: (2025)
Aligning Large Language Models by On-Policy Self-Judgment
par: Lee, Sangkyu, et autres
Publié: (2024)
par: Lee, Sangkyu, et autres
Publié: (2024)
Self-Evolving Critique Abilities in Large Language Models
par: Tang, Zhengyang, et autres
Publié: (2025)
par: Tang, Zhengyang, et autres
Publié: (2025)
Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models
par: Tsui, Ken
Publié: (2025)
par: Tsui, Ken
Publié: (2025)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
par: Zhang, Qingru, et autres
Publié: (2025)
par: Zhang, Qingru, et autres
Publié: (2025)
Stepwise Self-Consistent Mathematical Reasoning with Large Language Models
par: Zhao, Zilong, et autres
Publié: (2024)
par: Zhao, Zilong, et autres
Publié: (2024)
Self-Training Elicits Concise Reasoning in Large Language Models
par: Munkhbat, Tergel, et autres
Publié: (2025)
par: Munkhbat, Tergel, et autres
Publié: (2025)
SSR: Socratic Self-Refine for Large Language Model Reasoning
par: Shi, Haizhou, et autres
Publié: (2025)
par: Shi, Haizhou, et autres
Publié: (2025)
SLED: Self Logits Evolution Decoding for Improving Factuality in Large Language Models
par: Zhang, Jianyi, et autres
Publié: (2024)
par: Zhang, Jianyi, et autres
Publié: (2024)
Large Language Models Can Self-Improve At Web Agent Tasks
par: Patel, Ajay, et autres
Publié: (2024)
par: Patel, Ajay, et autres
Publié: (2024)
SAIL: Self-Improving Efficient Online Alignment of Large Language Models
par: Ding, Mucong, et autres
Publié: (2024)
par: Ding, Mucong, et autres
Publié: (2024)
Query-Conditioned Test-Time Self-Training for Large Language Models
par: Song, Chaehee, et autres
Publié: (2026)
par: Song, Chaehee, et autres
Publié: (2026)
ProgCo: Program Helps Self-Correction of Large Language Models
par: Song, Xiaoshuai, et autres
Publié: (2025)
par: Song, Xiaoshuai, et autres
Publié: (2025)
Self-contradictory Hallucinations of Large Language Models: Evaluation, Detection and Mitigation
par: Mündler, Niels, et autres
Publié: (2023)
par: Mündler, Niels, et autres
Publié: (2023)
SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models
par: Zhu, Hourun, et autres
Publié: (2025)
par: Zhu, Hourun, et autres
Publié: (2025)
Confidence-aware Self-Semantic Distillation on Knowledge Graph Embedding
par: Liu, Yichen, et autres
Publié: (2022)
par: Liu, Yichen, et autres
Publié: (2022)
Self-Recognition in Language Models
par: Davidson, Tim R., et autres
Publié: (2024)
par: Davidson, Tim R., et autres
Publié: (2024)
Rethinking Interpretability in the Era of Large Language Models
par: Singh, Chandan, et autres
Publié: (2024)
par: Singh, Chandan, et autres
Publié: (2024)
METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth
par: Li, Jiawei, et autres
Publié: (2024)
par: Li, Jiawei, et autres
Publié: (2024)
Scalable Best-of-N Selection for Large Language Models via Self-Certainty
par: Kang, Zhewei, et autres
Publié: (2025)
par: Kang, Zhewei, et autres
Publié: (2025)
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models
par: Lee, Jaeho, et autres
Publié: (2025)
par: Lee, Jaeho, et autres
Publié: (2025)
AXOLOTL: Fairness through Assisted Self-Debiasing of Large Language Model Outputs
par: Ebrahimi, Sana, et autres
Publié: (2024)
par: Ebrahimi, Sana, et autres
Publié: (2024)
Explorations of Self-Repair in Language Models
par: Rushing, Cody, et autres
Publié: (2024)
par: Rushing, Cody, et autres
Publié: (2024)
Interpretable Steering of Large Language Models with Feature Guided Activation Additions
par: Soo, Samuel, et autres
Publié: (2025)
par: Soo, Samuel, et autres
Publié: (2025)
Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
par: Chen, Zixiang, et autres
Publié: (2024)
par: Chen, Zixiang, et autres
Publié: (2024)
Binary Autoencoder for Mechanistic Interpretability of Large Language Models
par: Cho, Hakaze, et autres
Publié: (2025)
par: Cho, Hakaze, et autres
Publié: (2025)
Auto-Evolve: Enhancing Large Language Model's Performance via Self-Reasoning Framework
par: Aswani, Krishna, et autres
Publié: (2024)
par: Aswani, Krishna, et autres
Publié: (2024)
Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models
par: Dong, Guanting, et autres
Publié: (2024)
par: Dong, Guanting, et autres
Publié: (2024)
Demystifying Embedding Spaces using Large Language Models
par: Tennenholtz, Guy, et autres
Publié: (2023)
par: Tennenholtz, Guy, et autres
Publié: (2023)
UniSD: Towards a Unified Self-Distillation Framework for Large Language Models
par: Jin, Yiqiao, et autres
Publié: (2026)
par: Jin, Yiqiao, et autres
Publié: (2026)
Self-Supervised Position Debiasing for Large Language Models
par: Liu, Zhongkun, et autres
Publié: (2024)
par: Liu, Zhongkun, et autres
Publié: (2024)
Self-Generated Critiques Boost Reward Modeling for Language Models
par: Yu, Yue, et autres
Publié: (2024)
par: Yu, Yue, et autres
Publié: (2024)
Self-Improvement in Language Models: The Sharpening Mechanism
par: Huang, Audrey, et autres
Publié: (2024)
par: Huang, Audrey, et autres
Publié: (2024)
SimRAG: Self-Improving Retrieval-Augmented Generation for Adapting Large Language Models to Specialized Domains
par: Xu, Ran, et autres
Publié: (2024)
par: Xu, Ran, et autres
Publié: (2024)
Selective Self-Rehearsal: A Fine-Tuning Approach to Improve Generalization in Large Language Models
par: Gupta, Sonam, et autres
Publié: (2024)
par: Gupta, Sonam, et autres
Publié: (2024)
Auto-Intent: Automated Intent Discovery and Self-Exploration for Large Language Model Web Agents
par: Kim, Jaekyeom, et autres
Publié: (2024)
par: Kim, Jaekyeom, et autres
Publié: (2024)
STARLING: Self-supervised Training of Text-based Reinforcement Learning Agent with Large Language Models
par: Basavatia, Shreyas, et autres
Publié: (2024)
par: Basavatia, Shreyas, et autres
Publié: (2024)
Documents similaires
-
TeleTables: A Benchmark for Large Language Models in Telecom Table Interpretation
par: Ezzakri, Anas, et autres
Publié: (2025) -
LLMCheckup: Conversational Examination of Large Language Models via Interpretability Tools and Self-Explanations
par: Wang, Qianli, et autres
Publié: (2024) -
Large Language Models can be Strong Self-Detoxifiers
par: Ko, Ching-Yun, et autres
Publié: (2024) -
SelfCite: Self-Supervised Alignment for Context Attribution in Large Language Models
par: Chuang, Yung-Sung, et autres
Publié: (2025) -
Aligning Large Language Models by On-Policy Self-Judgment
par: Lee, Sangkyu, et autres
Publié: (2024)