Salvato in:
| Autori principali: | Wu, Yuanwei, Huang, Yue, Liu, Yixin, Li, Xiang, Zhou, Pan, Sun, Lichao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2407.16686 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts
di: Wu, Yuanwei, et al.
Pubblicazione: (2023)
di: Wu, Yuanwei, et al.
Pubblicazione: (2023)
FakeGPT: Fake News Generation, Explanation and Detection of Large Language Models
di: Huang, Yue, et al.
Pubblicazione: (2023)
di: Huang, Yue, et al.
Pubblicazione: (2023)
TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones
di: Yuan, Zhengqing, et al.
Pubblicazione: (2023)
di: Yuan, Zhengqing, et al.
Pubblicazione: (2023)
1+1>2: Can Large Language Models Serve as Cross-Lingual Knowledge Aggregators?
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
Jailbreaking Large Language Models Through Alignment Vulnerabilities in Out-of-Distribution Settings
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
Expert Threshold Routing for Autoregressive Language Modeling with Dynamic Computation Allocation and Load Balancing
di: Sun, Hanchi, et al.
Pubblicazione: (2026)
di: Sun, Hanchi, et al.
Pubblicazione: (2026)
MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use
di: Huang, Yue, et al.
Pubblicazione: (2023)
di: Huang, Yue, et al.
Pubblicazione: (2023)
Multilingual Jailbreak Challenges in Large Language Models
di: Deng, Yue, et al.
Pubblicazione: (2023)
di: Deng, Yue, et al.
Pubblicazione: (2023)
ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
di: Yuan, Zhengqing, et al.
Pubblicazione: (2023)
di: Yuan, Zhengqing, et al.
Pubblicazione: (2023)
I Think, Therefore I am: Benchmarking Awareness of Large Language Models Using AwareBench
di: Li, Yuan, et al.
Pubblicazione: (2024)
di: Li, Yuan, et al.
Pubblicazione: (2024)
Evaluating Large Language Models with Psychometrics
di: Li, Yuan, et al.
Pubblicazione: (2024)
di: Li, Yuan, et al.
Pubblicazione: (2024)
Radiology-GPT: A Large Language Model for Radiology
di: Liu, Zhengliang, et al.
Pubblicazione: (2023)
di: Liu, Zhengliang, et al.
Pubblicazione: (2023)
DeID-GPT: Zero-shot Medical Text De-Identification by GPT-4
di: Liu, Zhengliang, et al.
Pubblicazione: (2023)
di: Liu, Zhengliang, et al.
Pubblicazione: (2023)
Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models
di: Liu, Yanjiang, et al.
Pubblicazione: (2025)
di: Liu, Yanjiang, et al.
Pubblicazione: (2025)
Distract Large Language Models for Automatic Jailbreak Attack
di: Xiao, Zeguan, et al.
Pubblicazione: (2024)
di: Xiao, Zeguan, et al.
Pubblicazione: (2024)
LLM-as-a-Coauthor: Can Mixed Human-Written and Machine-Generated Text Be Detected?
di: Zhang, Qihui, et al.
Pubblicazione: (2024)
di: Zhang, Qihui, et al.
Pubblicazione: (2024)
Agentic AutoSurvey: Let LLMs Survey LLMs
di: Liu, Yixin, et al.
Pubblicazione: (2025)
di: Liu, Yixin, et al.
Pubblicazione: (2025)
EfficientLLM: Efficiency in Large Language Models
di: Yuan, Zhengqing, et al.
Pubblicazione: (2025)
di: Yuan, Zhengqing, et al.
Pubblicazione: (2025)
Weak-to-Strong Jailbreaking on Large Language Models
di: Zhao, Xuandong, et al.
Pubblicazione: (2024)
di: Zhao, Xuandong, et al.
Pubblicazione: (2024)
BiomedGPT: A Generalist Vision-Language Foundation Model for Diverse Biomedical Tasks
di: Zhang, Kai, et al.
Pubblicazione: (2023)
di: Zhang, Kai, et al.
Pubblicazione: (2023)
Self-Cognition in Large Language Models: An Exploratory Study
di: Chen, Dongping, et al.
Pubblicazione: (2024)
di: Chen, Dongping, et al.
Pubblicazione: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
AceGPT, Localizing Large Language Models in Arabic
di: Huang, Huang, et al.
Pubblicazione: (2023)
di: Huang, Huang, et al.
Pubblicazione: (2023)
DynHD: Hallucination Detection for Diffusion Large Language Models via Denoising Dynamics Deviation Learning
di: Qian, Yanyu, et al.
Pubblicazione: (2026)
di: Qian, Yanyu, et al.
Pubblicazione: (2026)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
di: Zhou, Weikang, et al.
Pubblicazione: (2024)
di: Zhou, Weikang, et al.
Pubblicazione: (2024)
CodeIP: A Grammar-Guided Multi-Bit Watermark for Large Language Models of Code
di: Guan, Batu, et al.
Pubblicazione: (2024)
di: Guan, Batu, et al.
Pubblicazione: (2024)
Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models
di: Sun, Xiaobing, et al.
Pubblicazione: (2026)
di: Sun, Xiaobing, et al.
Pubblicazione: (2026)
DataGen: Unified Synthetic Dataset Generation via Large Language Models
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
GP-GPT: Large Language Model for Gene-Phenotype Mapping
di: Lyu, Yanjun, et al.
Pubblicazione: (2024)
di: Lyu, Yanjun, et al.
Pubblicazione: (2024)
FinLLM-B: When Large Language Models Meet Financial Breakout Trading
di: Zhang, Kang, et al.
Pubblicazione: (2024)
di: Zhang, Kang, et al.
Pubblicazione: (2024)
HonestLLM: Toward an Honest and Helpful Large Language Model
di: Gao, Chujie, et al.
Pubblicazione: (2024)
di: Gao, Chujie, et al.
Pubblicazione: (2024)
Low-Resource Languages Jailbreak GPT-4
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2023)
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2023)
Enhancing Systematic Reviews with Large Language Models: Using GPT-4 and Kimi
di: Kaptur, Dandan Chen, et al.
Pubblicazione: (2025)
di: Kaptur, Dandan Chen, et al.
Pubblicazione: (2025)
Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective
di: Li, Tianlong, et al.
Pubblicazione: (2024)
di: Li, Tianlong, et al.
Pubblicazione: (2024)
Social Science Meets LLMs: How Reliable Are Large Language Models in Social Simulations?
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
Red Teaming GPT-4V: Are GPT-4V Safe Against Uni/Multi-Modal Jailbreak Attacks?
di: Chen, Shuo, et al.
Pubblicazione: (2024)
di: Chen, Shuo, et al.
Pubblicazione: (2024)
AutoSurvey: Large Language Models Can Automatically Write Surveys
di: Wang, Yidong, et al.
Pubblicazione: (2024)
di: Wang, Yidong, et al.
Pubblicazione: (2024)
Jailbreaking Large Language Models with Morality Attacks
di: Su, Ying, et al.
Pubblicazione: (2026)
di: Su, Ying, et al.
Pubblicazione: (2026)
Can Large Language Models Detect Rumors on Social Media?
di: Liu, Qiang, et al.
Pubblicazione: (2024)
di: Liu, Qiang, et al.
Pubblicazione: (2024)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
di: Yu, Miao, et al.
Pubblicazione: (2024)
di: Yu, Miao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts
di: Wu, Yuanwei, et al.
Pubblicazione: (2023) -
FakeGPT: Fake News Generation, Explanation and Detection of Large Language Models
di: Huang, Yue, et al.
Pubblicazione: (2023) -
TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones
di: Yuan, Zhengqing, et al.
Pubblicazione: (2023) -
1+1>2: Can Large Language Models Serve as Cross-Lingual Knowledge Aggregators?
di: Huang, Yue, et al.
Pubblicazione: (2024) -
Jailbreaking Large Language Models Through Alignment Vulnerabilities in Out-of-Distribution Settings
di: Huang, Yue, et al.
Pubblicazione: (2024)