Uniform Discretized Integrated Gradients: An effective attribution based method for explaining large language models
Fuente:
arXiv
Guardado en:
| Autores principales: | Roy, Swarnava Sinha, Kundu, Ayan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
On the attribution of confidence to large language models
por: Keeling, Geoff, et al.
Publicado: (2024)
por: Keeling, Geoff, et al.
Publicado: (2024)
Can adversarial attacks by large language models be attributed?
por: Cebrian, Manuel, et al.
Publicado: (2024)
por: Cebrian, Manuel, et al.
Publicado: (2024)
Dissociating language and thought in large language models
por: Mahowald, Kyle, et al.
Publicado: (2023)
por: Mahowald, Kyle, et al.
Publicado: (2023)
Emergent effects of scaling on the functional hierarchies within large language models
por: Bogdan, Paul C.
Publicado: (2025)
por: Bogdan, Paul C.
Publicado: (2025)
Streamlining evidence based clinical recommendations with large language models
por: Li, Dubai, et al.
Publicado: (2025)
por: Li, Dubai, et al.
Publicado: (2025)
Multi-round jailbreak attack on large language models
por: Zhou, Yihua, et al.
Publicado: (2024)
por: Zhou, Yihua, et al.
Publicado: (2024)
The 20 questions game to distinguish large language models
por: Richardeau, Gurvan, et al.
Publicado: (2024)
por: Richardeau, Gurvan, et al.
Publicado: (2024)
Quantifying non deterministic drift in large language models
por: Nicholson, Claire
Publicado: (2026)
por: Nicholson, Claire
Publicado: (2026)
Can large language models build causal graphs?
por: Long, Stephanie, et al.
Publicado: (2023)
por: Long, Stephanie, et al.
Publicado: (2023)
Response: Emergent analogical reasoning in large language models
por: Hodel, Damian, et al.
Publicado: (2023)
por: Hodel, Damian, et al.
Publicado: (2023)
Representation in large language models
por: Yetman, Cameron
Publicado: (2025)
por: Yetman, Cameron
Publicado: (2025)
Failure of contextual invariance in large language models
por: Kumar, Sagar, et al.
Publicado: (2026)
por: Kumar, Sagar, et al.
Publicado: (2026)
A survey of textual cyber abuse detection using cutting-edge language models and large language models
por: Diaz-Garcia, Jose A., et al.
Publicado: (2025)
por: Diaz-Garcia, Jose A., et al.
Publicado: (2025)
Strong and weak alignment of large language models with human values
por: Khamassi, Mehdi, et al.
Publicado: (2024)
por: Khamassi, Mehdi, et al.
Publicado: (2024)
Correcting misinformation on social media with a large language model
por: Zhou, Xinyi, et al.
Publicado: (2024)
por: Zhou, Xinyi, et al.
Publicado: (2024)
A review on the use of large language models as virtual tutors
por: García-Méndez, Silvia, et al.
Publicado: (2024)
por: García-Méndez, Silvia, et al.
Publicado: (2024)
Evaluating large language models in medical applications: a survey
por: Chen, Xiaolan, et al.
Publicado: (2024)
por: Chen, Xiaolan, et al.
Publicado: (2024)
MathDivide: Improved mathematical reasoning by large language models
por: Srivastava, Saksham Sahai, et al.
Publicado: (2024)
por: Srivastava, Saksham Sahai, et al.
Publicado: (2024)
Re-evaluating Theory of Mind evaluation in large language models
por: Hu, Jennifer, et al.
Publicado: (2025)
por: Hu, Jennifer, et al.
Publicado: (2025)
Disentangling generalization and memorization in large language models using chess
por: Pleiss, Leonard S., et al.
Publicado: (2026)
por: Pleiss, Leonard S., et al.
Publicado: (2026)
AI-AI Bias: large language models favor communications generated by large language models
por: Laurito, Walter, et al.
Publicado: (2024)
por: Laurito, Walter, et al.
Publicado: (2024)
Alignment faking in large language models
por: Greenblatt, Ryan, et al.
Publicado: (2024)
por: Greenblatt, Ryan, et al.
Publicado: (2024)
Optimizing watermarks for large language models
por: Wouters, Bram
Publicado: (2023)
por: Wouters, Bram
Publicado: (2023)
Uncovering inequalities in new knowledge learning by large language models across different languages
por: Wang, Chenglong, et al.
Publicado: (2025)
por: Wang, Chenglong, et al.
Publicado: (2025)
Entry-level guide to the use of large language models for medical research
por: Jin, Qiao, et al.
Publicado: (2024)
por: Jin, Qiao, et al.
Publicado: (2024)
Facilitating large language model Russian adaptation with Learned Embedding Propagation
por: Tikhomirov, Mikhail, et al.
Publicado: (2024)
por: Tikhomirov, Mikhail, et al.
Publicado: (2024)
MacBehaviour: An R package for behavioural experimentation on large language models
por: Duan, Xufeng, et al.
Publicado: (2024)
por: Duan, Xufeng, et al.
Publicado: (2024)
Hyacinth6B: A large language model for Traditional Chinese
por: Song, Chih-Wei, et al.
Publicado: (2024)
por: Song, Chih-Wei, et al.
Publicado: (2024)
Can large language models understand uncommon meanings of common words?
por: Wu, Jinyang, et al.
Publicado: (2024)
por: Wu, Jinyang, et al.
Publicado: (2024)
Generating bilingual example sentences with large language models as lexicography assistants
por: Merx, Raphael, et al.
Publicado: (2024)
por: Merx, Raphael, et al.
Publicado: (2024)
Leveraging large language models for efficient representation learning for entity resolution
por: Xu, Xiaowei, et al.
Publicado: (2024)
por: Xu, Xiaowei, et al.
Publicado: (2024)
Are they human? Detecting large language models by probing human memory constraints
por: Schug, Simon, et al.
Publicado: (2026)
por: Schug, Simon, et al.
Publicado: (2026)
A blind spot for large language models: Supradiegetic linguistic information
por: Zimmerman, Julia Witte, et al.
Publicado: (2023)
por: Zimmerman, Julia Witte, et al.
Publicado: (2023)
ARC-Encoder: learning compressed text representations for large language models
por: Pilchen, Hippolyte, et al.
Publicado: (2025)
por: Pilchen, Hippolyte, et al.
Publicado: (2025)
Enhancing reasoning accuracy in large language models during inference time
por: Sharma, Vinay, et al.
Publicado: (2026)
por: Sharma, Vinay, et al.
Publicado: (2026)
ZNO-Eval: Benchmarking reasoning capabilities of large language models in Ukrainian
por: Syromiatnikov, Mykyta, et al.
Publicado: (2025)
por: Syromiatnikov, Mykyta, et al.
Publicado: (2025)
ChildEval: When large language models meet children's personalities
por: Luo, Yanyan, et al.
Publicado: (2026)
por: Luo, Yanyan, et al.
Publicado: (2026)
Medical large language models are easily distracted
por: Vishwanath, Krithik, et al.
Publicado: (2025)
por: Vishwanath, Krithik, et al.
Publicado: (2025)
What can large language models do for sustainable food?
por: Thomas, Anna T., et al.
Publicado: (2025)
por: Thomas, Anna T., et al.
Publicado: (2025)
Long-form factuality in large language models
por: Wei, Jerry, et al.
Publicado: (2024)
por: Wei, Jerry, et al.
Publicado: (2024)
Ejemplares similares
-
On the attribution of confidence to large language models
por: Keeling, Geoff, et al.
Publicado: (2024) -
Can adversarial attacks by large language models be attributed?
por: Cebrian, Manuel, et al.
Publicado: (2024) -
Dissociating language and thought in large language models
por: Mahowald, Kyle, et al.
Publicado: (2023) -
Emergent effects of scaling on the functional hierarchies within large language models
por: Bogdan, Paul C.
Publicado: (2025) -
Streamlining evidence based clinical recommendations with large language models
por: Li, Dubai, et al.
Publicado: (2025)