Fine-Grained Interpretation of Political Opinions in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Hu, Jingyu, Yang, Mengyue, Du, Mengnan, Liu, Weiru |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Strategic Demonstration Selection for Improved Fairness in LLM In-Context Learning
por: Hu, Jingyu, et al.
Publicado: (2024)
por: Hu, Jingyu, et al.
Publicado: (2024)
ProxiMix: Enhancing Fairness with Proximity Samples in Subgroups
por: Hu, Jingyu, et al.
Publicado: (2024)
por: Hu, Jingyu, et al.
Publicado: (2024)
A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models
por: Shu, Dong, et al.
Publicado: (2025)
por: Shu, Dong, et al.
Publicado: (2025)
Mitigating Degree Bias Adaptively with Hard-to-Learn Nodes in Graph Contrastive Learning
por: Hu, Jingyu, et al.
Publicado: (2025)
por: Hu, Jingyu, et al.
Publicado: (2025)
Exploring Multilingual Probing in Large Language Models: A Cross-Language Analysis
por: Li, Daoyang, et al.
Publicado: (2024)
por: Li, Daoyang, et al.
Publicado: (2024)
SAIF: A Sparse Autoencoder Framework for Interpreting and Steering Instruction Following of Language Models
por: He, Zirui, et al.
Publicado: (2025)
por: He, Zirui, et al.
Publicado: (2025)
FaithLM: Towards Faithful Explanations for Large Language Models
por: Chuang, Yu-Neng, et al.
Publicado: (2024)
por: Chuang, Yu-Neng, et al.
Publicado: (2024)
Comparative Analysis of Demonstration Selection Algorithms for LLM In-Context Learning
por: Shu, Dong, et al.
Publicado: (2024)
por: Shu, Dong, et al.
Publicado: (2024)
FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models
por: Weng, Zixuan, et al.
Publicado: (2026)
por: Weng, Zixuan, et al.
Publicado: (2026)
Language Ranker: A Metric for Quantifying LLM Performance Across High and Low-Resource Languages
por: Li, Zihao, et al.
Publicado: (2024)
por: Li, Zihao, et al.
Publicado: (2024)
Sparse is Enough in Fine-tuning Pre-trained Large Language Models
por: Song, Weixi, et al.
Publicado: (2023)
por: Song, Weixi, et al.
Publicado: (2023)
Binary Autoencoder for Mechanistic Interpretability of Large Language Models
por: Cho, Hakaze, et al.
Publicado: (2025)
por: Cho, Hakaze, et al.
Publicado: (2025)
InstructAV: Instruction Fine-tuning Large Language Models for Authorship Verification
por: Hu, Yujia, et al.
Publicado: (2024)
por: Hu, Yujia, et al.
Publicado: (2024)
PoliTune: Analyzing the Impact of Data Selection and Fine-Tuning on Economic and Political Biases in Large Language Models
por: Agiza, Ahmed, et al.
Publicado: (2024)
por: Agiza, Ahmed, et al.
Publicado: (2024)
Dynamic Correction of Erroneous State Estimates via Diffusion Bayesian Exploration
por: Shi, Yiwei, et al.
Publicado: (2025)
por: Shi, Yiwei, et al.
Publicado: (2025)
AI-Augmented Surveys: Leveraging Large Language Models and Surveys for Opinion Prediction
por: Kim, Junsol, et al.
Publicado: (2023)
por: Kim, Junsol, et al.
Publicado: (2023)
PAT: Pruning-Aware Tuning for Large Language Models
por: Liu, Yijiang, et al.
Publicado: (2024)
por: Liu, Yijiang, et al.
Publicado: (2024)
Rethinking Interpretability in the Era of Large Language Models
por: Singh, Chandan, et al.
Publicado: (2024)
por: Singh, Chandan, et al.
Publicado: (2024)
AutoMLGen: Navigating Fine-Grained Optimization for Coding Agents
por: Du, Shangheng, et al.
Publicado: (2025)
por: Du, Shangheng, et al.
Publicado: (2025)
Exploring Concept Depth: How Large Language Models Acquire Knowledge and Concept at Different Layers?
por: Jin, Mingyu, et al.
Publicado: (2024)
por: Jin, Mingyu, et al.
Publicado: (2024)
Beyond Prior Limits: Addressing Distribution Misalignment in Particle Filtering
por: Shi, Yiwei, et al.
Publicado: (2025)
por: Shi, Yiwei, et al.
Publicado: (2025)
Beyond Single Concept Vector: Modeling Concept Subspace in LLMs with Gaussian Distribution
por: Zhao, Haiyan, et al.
Publicado: (2024)
por: Zhao, Haiyan, et al.
Publicado: (2024)
Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework
por: Weng, Jiaqi, et al.
Publicado: (2025)
por: Weng, Jiaqi, et al.
Publicado: (2025)
Boosting Large Language Models with Mask Fine-Tuning
por: Zhang, Mingyuan, et al.
Publicado: (2025)
por: Zhang, Mingyuan, et al.
Publicado: (2025)
Scaling Sparse Fine-Tuning to Large Language Models
por: Ansell, Alan, et al.
Publicado: (2024)
por: Ansell, Alan, et al.
Publicado: (2024)
Natural Language Reinforcement Learning
por: Feng, Xidong, et al.
Publicado: (2024)
por: Feng, Xidong, et al.
Publicado: (2024)
Hyperbolic Fine-Tuning for Large Language Models
por: Yang, Menglin, et al.
Publicado: (2024)
por: Yang, Menglin, et al.
Publicado: (2024)
Benchmarking Gender and Political Bias in Large Language Models
por: Yang, Jinrui, et al.
Publicado: (2025)
por: Yang, Jinrui, et al.
Publicado: (2025)
Cyclic Vision-Language Manipulator: Towards Reliable and Fine-Grained Image Interpretation for Automated Report Generation
por: Fang, Yingying, et al.
Publicado: (2024)
por: Fang, Yingying, et al.
Publicado: (2024)
Beyond Input Activations: Identifying Influential Latents by Gradient Sparse Autoencoders
por: Shu, Dong, et al.
Publicado: (2025)
por: Shu, Dong, et al.
Publicado: (2025)
Liger: Linearizing Large Language Models to Gated Recurrent Structures
por: Lan, Disen, et al.
Publicado: (2025)
por: Lan, Disen, et al.
Publicado: (2025)
Towards Interpretable Hate Speech Detection using Large Language Model-extracted Rationales
por: Nirmal, Ayushi, et al.
Publicado: (2024)
por: Nirmal, Ayushi, et al.
Publicado: (2024)
SelfIE: Self-Interpretation of Large Language Model Embeddings
por: Chen, Haozhe, et al.
Publicado: (2024)
por: Chen, Haozhe, et al.
Publicado: (2024)
TracrBench: Generating Interpretability Testbeds with Large Language Models
por: Thurnherr, Hannes, et al.
Publicado: (2024)
por: Thurnherr, Hannes, et al.
Publicado: (2024)
Improving Large Language Models with Concept-Aware Fine-Tuning
por: Chen, Michael K., et al.
Publicado: (2025)
por: Chen, Michael K., et al.
Publicado: (2025)
Aligning Large Language Models via Fine-grained Supervision
por: Xu, Dehong, et al.
Publicado: (2024)
por: Xu, Dehong, et al.
Publicado: (2024)
Crafting Efficient Fine-Tuning Strategies for Large Language Models
por: Oliver, Michael, et al.
Publicado: (2024)
por: Oliver, Michael, et al.
Publicado: (2024)
Fine-Grained Uncertainty Quantification for Long-Form Language Model Outputs: A Comparative Study
por: Bouchard, Dylan, et al.
Publicado: (2026)
por: Bouchard, Dylan, et al.
Publicado: (2026)
Large Language Model Unlearning
por: Yao, Yuanshun, et al.
Publicado: (2023)
por: Yao, Yuanshun, et al.
Publicado: (2023)
All Language Models Large and Small
por: Chen, Zhixun, et al.
Publicado: (2024)
por: Chen, Zhixun, et al.
Publicado: (2024)
Ejemplares similares
-
Strategic Demonstration Selection for Improved Fairness in LLM In-Context Learning
por: Hu, Jingyu, et al.
Publicado: (2024) -
ProxiMix: Enhancing Fairness with Proximity Samples in Subgroups
por: Hu, Jingyu, et al.
Publicado: (2024) -
A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models
por: Shu, Dong, et al.
Publicado: (2025) -
Mitigating Degree Bias Adaptively with Hard-to-Learn Nodes in Graph Contrastive Learning
por: Hu, Jingyu, et al.
Publicado: (2025) -
Exploring Multilingual Probing in Large Language Models: A Cross-Language Analysis
por: Li, Daoyang, et al.
Publicado: (2024)