Guardado en:
| Autores principales: | Zhang, Zhiyao, Mash'Al, Yazan, Wu, Yuhan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2601.06700 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Integrating Chemistry Knowledge in Large Language Models via Prompt Engineering
por: Liu, Hongxuan, et al.
Publicado: (2024)
por: Liu, Hongxuan, et al.
Publicado: (2024)
Realistic Evaluation of Toxicity in Large Language Models
por: Luong, Tinh Son, et al.
Publicado: (2024)
por: Luong, Tinh Son, et al.
Publicado: (2024)
Induction Head Toxicity Mechanistically Explains Repetition Curse in Large Language Models
por: Wang, Shuxun, et al.
Publicado: (2025)
por: Wang, Shuxun, et al.
Publicado: (2025)
Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation
por: Zhang, Zhibo, et al.
Publicado: (2025)
por: Zhang, Zhibo, et al.
Publicado: (2025)
Characterizing Large Language Model Geometry Helps Solve Toxicity Detection and Generation
por: Balestriero, Randall, et al.
Publicado: (2023)
por: Balestriero, Randall, et al.
Publicado: (2023)
GraphArena: Evaluating and Exploring Large Language Models on Graph Computation
por: Tang, Jianheng, et al.
Publicado: (2024)
por: Tang, Jianheng, et al.
Publicado: (2024)
Large Language Models Badly Generalize across Option Length, Problem Types, and Irrelevant Noun Replacements
por: Zhao, Guangxiang, et al.
Publicado: (2025)
por: Zhao, Guangxiang, et al.
Publicado: (2025)
Rethinking Toxicity Evaluation in Large Language Models: A Multi-Label Perspective
por: Kou, Zhiqiang, et al.
Publicado: (2025)
por: Kou, Zhiqiang, et al.
Publicado: (2025)
Characterising the Creative Process in Humans and Large Language Models
por: Nath, Surabhi S., et al.
Publicado: (2024)
por: Nath, Surabhi S., et al.
Publicado: (2024)
How Toxic Can You Get? Search-based Toxicity Testing for Large Language Models
por: Corbo, Simone, et al.
Publicado: (2025)
por: Corbo, Simone, et al.
Publicado: (2025)
A Survey of Large Language Models for Arabic Language and its Dialects
por: Mashaabi, Malak, et al.
Publicado: (2024)
por: Mashaabi, Malak, et al.
Publicado: (2024)
Generative Monoculture in Large Language Models
por: Wu, Fan, et al.
Publicado: (2024)
por: Wu, Fan, et al.
Publicado: (2024)
Introducing Background Temperature to Characterise Hidden Randomness in Large Language Models
por: Messina, Alberto, et al.
Publicado: (2026)
por: Messina, Alberto, et al.
Publicado: (2026)
The Impact of Quantization on Retrieval-Augmented Generation: An Analysis of Small LLMs
por: Yazan, Mert, et al.
Publicado: (2024)
por: Yazan, Mert, et al.
Publicado: (2024)
ToxSearch: Evolving Prompts for Toxicity Search in Large Language Models
por: Shelar, Onkar, et al.
Publicado: (2025)
por: Shelar, Onkar, et al.
Publicado: (2025)
Walking in Others' Shoes: How Perspective-Taking Guides Large Language Models in Reducing Toxicity and Bias
por: Xu, Rongwu, et al.
Publicado: (2024)
por: Xu, Rongwu, et al.
Publicado: (2024)
Testing and Evaluation of Large Language Models: Correctness, Non-Toxicity, and Fairness
por: Wang, Wenxuan
Publicado: (2024)
por: Wang, Wenxuan
Publicado: (2024)
Atoxia: Red-teaming Large Language Models with Target Toxic Answers
por: Du, Yuhao, et al.
Publicado: (2024)
por: Du, Yuhao, et al.
Publicado: (2024)
Knowledge Crosswords: Geometric Knowledge Reasoning with Large Language Models
por: Ding, Wenxuan, et al.
Publicado: (2023)
por: Ding, Wenxuan, et al.
Publicado: (2023)
Efficient Detection of Toxic Prompts in Large Language Models
por: Liu, Yi, et al.
Publicado: (2024)
por: Liu, Yi, et al.
Publicado: (2024)
Dynamic Generation of Personalities with Large Language Models
por: Liu, Jianzhi, et al.
Publicado: (2024)
por: Liu, Jianzhi, et al.
Publicado: (2024)
OFFSIDE: Benchmarking Unlearning Misinformation in Multimodal Large Language Models
por: Zheng, Hao, et al.
Publicado: (2025)
por: Zheng, Hao, et al.
Publicado: (2025)
QExplorer: Large Language Model Based Query Extraction for Toxic Content Exploration
por: Ren, Shaola, et al.
Publicado: (2025)
por: Ren, Shaola, et al.
Publicado: (2025)
Whispering Experts: Neural Interventions for Toxicity Mitigation in Language Models
por: Suau, Xavier, et al.
Publicado: (2024)
por: Suau, Xavier, et al.
Publicado: (2024)
MDIT-Bench: Evaluating the Dual-Implicit Toxicity in Large Multimodal Models
por: Jin, Bohan, et al.
Publicado: (2025)
por: Jin, Bohan, et al.
Publicado: (2025)
Knowledge-tuning Large Language Models with Structured Medical Knowledge Bases for Reliable Response Generation in Chinese
por: Wang, Haochun, et al.
Publicado: (2023)
por: Wang, Haochun, et al.
Publicado: (2023)
GloSS over Toxicity: Understanding and Mitigating Toxicity in LLMs via Global Toxic Subspace
por: Duan, Zenghao, et al.
Publicado: (2025)
por: Duan, Zenghao, et al.
Publicado: (2025)
The Arabic AI Fingerprint: Stylometric Analysis and Detection of Large Language Models Text
por: Al-Shaibani, Maged S., et al.
Publicado: (2025)
por: Al-Shaibani, Maged S., et al.
Publicado: (2025)
SMARTER: A Data-efficient Framework to Improve Toxicity Detection with Explanation via Self-augmenting Large Language Models
por: Nghiem, Huy, et al.
Publicado: (2025)
por: Nghiem, Huy, et al.
Publicado: (2025)
Pruning General Large Language Models into Customized Expert Models
por: Zhao, Yirao, et al.
Publicado: (2025)
por: Zhao, Yirao, et al.
Publicado: (2025)
From One to Many: Expanding the Scope of Toxicity Mitigation in Language Models
por: Pozzobon, Luiza, et al.
Publicado: (2024)
por: Pozzobon, Luiza, et al.
Publicado: (2024)
A Survey on Efficient Inference for Large Language Models
por: Zhou, Zixuan, et al.
Publicado: (2024)
por: Zhou, Zixuan, et al.
Publicado: (2024)
APCD: Adaptive Path-Contrastive Decoding for Reliable Large Language Model Generation
por: Zheng, Tianyu, et al.
Publicado: (2026)
por: Zheng, Tianyu, et al.
Publicado: (2026)
Cacheback: Speculative Decoding With Nothing But Cache
por: Ma, Zhiyao, et al.
Publicado: (2025)
por: Ma, Zhiyao, et al.
Publicado: (2025)
Can Large Language Models Predict the Outcome of Judicial Decisions?
por: Kmainasi, Mohamed Bayan, et al.
Publicado: (2025)
por: Kmainasi, Mohamed Bayan, et al.
Publicado: (2025)
QUILL: Quotation Generation Enhancement of Large Language Models
por: Xiao, Jin, et al.
Publicado: (2024)
por: Xiao, Jin, et al.
Publicado: (2024)
RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models
por: Wang, Zekun Moore, et al.
Publicado: (2023)
por: Wang, Zekun Moore, et al.
Publicado: (2023)
MEGen: Generative Backdoor into Large Language Models via Model Editing
por: Qiu, Jiyang, et al.
Publicado: (2024)
por: Qiu, Jiyang, et al.
Publicado: (2024)
Deep Learning Detection Method for Large Language Models-Generated Scientific Content
por: Alhijawi, Bushra, et al.
Publicado: (2024)
por: Alhijawi, Bushra, et al.
Publicado: (2024)
ALLaM: Large Language Models for Arabic and English
por: Bari, M Saiful, et al.
Publicado: (2024)
por: Bari, M Saiful, et al.
Publicado: (2024)
Ejemplares similares
-
Integrating Chemistry Knowledge in Large Language Models via Prompt Engineering
por: Liu, Hongxuan, et al.
Publicado: (2024) -
Realistic Evaluation of Toxicity in Large Language Models
por: Luong, Tinh Son, et al.
Publicado: (2024) -
Induction Head Toxicity Mechanistically Explains Repetition Curse in Large Language Models
por: Wang, Shuxun, et al.
Publicado: (2025) -
Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation
por: Zhang, Zhibo, et al.
Publicado: (2025) -
Characterizing Large Language Model Geometry Helps Solve Toxicity Detection and Generation
por: Balestriero, Randall, et al.
Publicado: (2023)