Fine-Grained Interpretation of Political Opinions in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Jingyu, Yang, Mengyue, Du, Mengnan, Liu, Weiru |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Strategic Demonstration Selection for Improved Fairness in LLM In-Context Learning
di: Hu, Jingyu, et al.
Pubblicazione: (2024)
di: Hu, Jingyu, et al.
Pubblicazione: (2024)
ProxiMix: Enhancing Fairness with Proximity Samples in Subgroups
di: Hu, Jingyu, et al.
Pubblicazione: (2024)
di: Hu, Jingyu, et al.
Pubblicazione: (2024)
A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models
di: Shu, Dong, et al.
Pubblicazione: (2025)
di: Shu, Dong, et al.
Pubblicazione: (2025)
Mitigating Degree Bias Adaptively with Hard-to-Learn Nodes in Graph Contrastive Learning
di: Hu, Jingyu, et al.
Pubblicazione: (2025)
di: Hu, Jingyu, et al.
Pubblicazione: (2025)
Exploring Multilingual Probing in Large Language Models: A Cross-Language Analysis
di: Li, Daoyang, et al.
Pubblicazione: (2024)
di: Li, Daoyang, et al.
Pubblicazione: (2024)
SAIF: A Sparse Autoencoder Framework for Interpreting and Steering Instruction Following of Language Models
di: He, Zirui, et al.
Pubblicazione: (2025)
di: He, Zirui, et al.
Pubblicazione: (2025)
FaithLM: Towards Faithful Explanations for Large Language Models
di: Chuang, Yu-Neng, et al.
Pubblicazione: (2024)
di: Chuang, Yu-Neng, et al.
Pubblicazione: (2024)
Comparative Analysis of Demonstration Selection Algorithms for LLM In-Context Learning
di: Shu, Dong, et al.
Pubblicazione: (2024)
di: Shu, Dong, et al.
Pubblicazione: (2024)
FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models
di: Weng, Zixuan, et al.
Pubblicazione: (2026)
di: Weng, Zixuan, et al.
Pubblicazione: (2026)
Language Ranker: A Metric for Quantifying LLM Performance Across High and Low-Resource Languages
di: Li, Zihao, et al.
Pubblicazione: (2024)
di: Li, Zihao, et al.
Pubblicazione: (2024)
Sparse is Enough in Fine-tuning Pre-trained Large Language Models
di: Song, Weixi, et al.
Pubblicazione: (2023)
di: Song, Weixi, et al.
Pubblicazione: (2023)
Binary Autoencoder for Mechanistic Interpretability of Large Language Models
di: Cho, Hakaze, et al.
Pubblicazione: (2025)
di: Cho, Hakaze, et al.
Pubblicazione: (2025)
InstructAV: Instruction Fine-tuning Large Language Models for Authorship Verification
di: Hu, Yujia, et al.
Pubblicazione: (2024)
di: Hu, Yujia, et al.
Pubblicazione: (2024)
PoliTune: Analyzing the Impact of Data Selection and Fine-Tuning on Economic and Political Biases in Large Language Models
di: Agiza, Ahmed, et al.
Pubblicazione: (2024)
di: Agiza, Ahmed, et al.
Pubblicazione: (2024)
Dynamic Correction of Erroneous State Estimates via Diffusion Bayesian Exploration
di: Shi, Yiwei, et al.
Pubblicazione: (2025)
di: Shi, Yiwei, et al.
Pubblicazione: (2025)
AI-Augmented Surveys: Leveraging Large Language Models and Surveys for Opinion Prediction
di: Kim, Junsol, et al.
Pubblicazione: (2023)
di: Kim, Junsol, et al.
Pubblicazione: (2023)
PAT: Pruning-Aware Tuning for Large Language Models
di: Liu, Yijiang, et al.
Pubblicazione: (2024)
di: Liu, Yijiang, et al.
Pubblicazione: (2024)
Rethinking Interpretability in the Era of Large Language Models
di: Singh, Chandan, et al.
Pubblicazione: (2024)
di: Singh, Chandan, et al.
Pubblicazione: (2024)
AutoMLGen: Navigating Fine-Grained Optimization for Coding Agents
di: Du, Shangheng, et al.
Pubblicazione: (2025)
di: Du, Shangheng, et al.
Pubblicazione: (2025)
Exploring Concept Depth: How Large Language Models Acquire Knowledge and Concept at Different Layers?
di: Jin, Mingyu, et al.
Pubblicazione: (2024)
di: Jin, Mingyu, et al.
Pubblicazione: (2024)
Beyond Prior Limits: Addressing Distribution Misalignment in Particle Filtering
di: Shi, Yiwei, et al.
Pubblicazione: (2025)
di: Shi, Yiwei, et al.
Pubblicazione: (2025)
Beyond Single Concept Vector: Modeling Concept Subspace in LLMs with Gaussian Distribution
di: Zhao, Haiyan, et al.
Pubblicazione: (2024)
di: Zhao, Haiyan, et al.
Pubblicazione: (2024)
Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework
di: Weng, Jiaqi, et al.
Pubblicazione: (2025)
di: Weng, Jiaqi, et al.
Pubblicazione: (2025)
Boosting Large Language Models with Mask Fine-Tuning
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
Scaling Sparse Fine-Tuning to Large Language Models
di: Ansell, Alan, et al.
Pubblicazione: (2024)
di: Ansell, Alan, et al.
Pubblicazione: (2024)
Natural Language Reinforcement Learning
di: Feng, Xidong, et al.
Pubblicazione: (2024)
di: Feng, Xidong, et al.
Pubblicazione: (2024)
Hyperbolic Fine-Tuning for Large Language Models
di: Yang, Menglin, et al.
Pubblicazione: (2024)
di: Yang, Menglin, et al.
Pubblicazione: (2024)
Benchmarking Gender and Political Bias in Large Language Models
di: Yang, Jinrui, et al.
Pubblicazione: (2025)
di: Yang, Jinrui, et al.
Pubblicazione: (2025)
Cyclic Vision-Language Manipulator: Towards Reliable and Fine-Grained Image Interpretation for Automated Report Generation
di: Fang, Yingying, et al.
Pubblicazione: (2024)
di: Fang, Yingying, et al.
Pubblicazione: (2024)
Beyond Input Activations: Identifying Influential Latents by Gradient Sparse Autoencoders
di: Shu, Dong, et al.
Pubblicazione: (2025)
di: Shu, Dong, et al.
Pubblicazione: (2025)
Liger: Linearizing Large Language Models to Gated Recurrent Structures
di: Lan, Disen, et al.
Pubblicazione: (2025)
di: Lan, Disen, et al.
Pubblicazione: (2025)
Towards Interpretable Hate Speech Detection using Large Language Model-extracted Rationales
di: Nirmal, Ayushi, et al.
Pubblicazione: (2024)
di: Nirmal, Ayushi, et al.
Pubblicazione: (2024)
SelfIE: Self-Interpretation of Large Language Model Embeddings
di: Chen, Haozhe, et al.
Pubblicazione: (2024)
di: Chen, Haozhe, et al.
Pubblicazione: (2024)
TracrBench: Generating Interpretability Testbeds with Large Language Models
di: Thurnherr, Hannes, et al.
Pubblicazione: (2024)
di: Thurnherr, Hannes, et al.
Pubblicazione: (2024)
Improving Large Language Models with Concept-Aware Fine-Tuning
di: Chen, Michael K., et al.
Pubblicazione: (2025)
di: Chen, Michael K., et al.
Pubblicazione: (2025)
Aligning Large Language Models via Fine-grained Supervision
di: Xu, Dehong, et al.
Pubblicazione: (2024)
di: Xu, Dehong, et al.
Pubblicazione: (2024)
Crafting Efficient Fine-Tuning Strategies for Large Language Models
di: Oliver, Michael, et al.
Pubblicazione: (2024)
di: Oliver, Michael, et al.
Pubblicazione: (2024)
Fine-Grained Uncertainty Quantification for Long-Form Language Model Outputs: A Comparative Study
di: Bouchard, Dylan, et al.
Pubblicazione: (2026)
di: Bouchard, Dylan, et al.
Pubblicazione: (2026)
Large Language Model Unlearning
di: Yao, Yuanshun, et al.
Pubblicazione: (2023)
di: Yao, Yuanshun, et al.
Pubblicazione: (2023)
All Language Models Large and Small
di: Chen, Zhixun, et al.
Pubblicazione: (2024)
di: Chen, Zhixun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Strategic Demonstration Selection for Improved Fairness in LLM In-Context Learning
di: Hu, Jingyu, et al.
Pubblicazione: (2024) -
ProxiMix: Enhancing Fairness with Proximity Samples in Subgroups
di: Hu, Jingyu, et al.
Pubblicazione: (2024) -
A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models
di: Shu, Dong, et al.
Pubblicazione: (2025) -
Mitigating Degree Bias Adaptively with Hard-to-Learn Nodes in Graph Contrastive Learning
di: Hu, Jingyu, et al.
Pubblicazione: (2025) -
Exploring Multilingual Probing in Large Language Models: A Cross-Language Analysis
di: Li, Daoyang, et al.
Pubblicazione: (2024)