Saved in:
| Main Authors: | Xin, Yuan, Li, Zheng, Yu, Ning, Chen, Dingfan, Fritz, Mario, Backes, Michael, Zhang, Yang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2408.11046 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Jailbreaking Attacks vs. Content Safety Filters: How Far Are We in the LLM Safety Arms Race?
by: Xin, Yuan, et al.
Published: (2025)
by: Xin, Yuan, et al.
Published: (2025)
Provably Cost-Sensitive Adversarial Defense via Randomized Smoothing
by: Xin, Yuan, et al.
Published: (2023)
by: Xin, Yuan, et al.
Published: (2023)
PoLLMgraph: Unraveling Hallucinations in Large Language Models via State Transition Dynamics
by: Zhu, Derui, et al.
Published: (2024)
by: Zhu, Derui, et al.
Published: (2024)
Reconsidering Degeneration of Token Embeddings with Definitions for Encoder-based Pre-trained Language Models
by: Zhang, Ying, et al.
Published: (2024)
by: Zhang, Ying, et al.
Published: (2024)
Probing Language Models for Pre-training Data Detection
by: Liu, Zhenhua, et al.
Published: (2024)
by: Liu, Zhenhua, et al.
Published: (2024)
Reconstruct Your Previous Conversations! Comprehensively Investigating Privacy Leakage Risks in Conversations with GPT Models
by: Chu, Junjie, et al.
Published: (2024)
by: Chu, Junjie, et al.
Published: (2024)
Automated Detection of Pre-training Text in Black-box LLMs
by: Hu, Ruihan, et al.
Published: (2025)
by: Hu, Ruihan, et al.
Published: (2025)
From Unfamiliar to Familiar: Detecting Pre-training Data via Gradient Deviations in Large Language Models
by: Zhang, Ruiqi, et al.
Published: (2026)
by: Zhang, Ruiqi, et al.
Published: (2026)
On Leveraging Encoder-only Pre-trained Language Models for Effective Keyphrase Generation
by: Wu, Di, et al.
Published: (2024)
by: Wu, Di, et al.
Published: (2024)
Knowledge Distillation of Black-Box Large Language Models
by: Chen, Hongzhan, et al.
Published: (2024)
by: Chen, Hongzhan, et al.
Published: (2024)
Black-Box Segmentation of Electronic Medical Records
by: Yuan, Hongyi, et al.
Published: (2024)
by: Yuan, Hongyi, et al.
Published: (2024)
Fine-tuning Pre-trained Language Models for Few-shot Intent Detection: Supervised Pre-training and Isotropization
by: Zhang, Haode, et al.
Published: (2022)
by: Zhang, Haode, et al.
Published: (2022)
Nemotron-CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training
by: Diao, Shizhe, et al.
Published: (2025)
by: Diao, Shizhe, et al.
Published: (2025)
Memory Reviving, Continuing Learning and Beyond: Evaluation of Pre-trained Encoders and Decoders for Multimodal Machine Translation
by: Yu, Zhuang, et al.
Published: (2025)
by: Yu, Zhuang, et al.
Published: (2025)
OPUS: Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration
by: Wang, Shaobo, et al.
Published: (2026)
by: Wang, Shaobo, et al.
Published: (2026)
NuNER: Entity Recognition Encoder Pre-training via LLM-Annotated Data
by: Bogdanov, Sergei, et al.
Published: (2024)
by: Bogdanov, Sergei, et al.
Published: (2024)
Membership Inference Attacks Against In-Context Learning
by: Wen, Rui, et al.
Published: (2024)
by: Wen, Rui, et al.
Published: (2024)
Masked Structural Growth for 2x Faster Language Model Pre-training
by: Yao, Yiqun, et al.
Published: (2023)
by: Yao, Yiqun, et al.
Published: (2023)
Relational Prompt-based Pre-trained Language Models for Social Event Detection
by: Li, Pu, et al.
Published: (2024)
by: Li, Pu, et al.
Published: (2024)
Text to Band Gap: Pre-trained Language Models as Encoders for Semiconductor Band Gap Prediction
by: Yeh, Ying-Ting, et al.
Published: (2025)
by: Yeh, Ying-Ting, et al.
Published: (2025)
Generalist Reward Models: Found Inside Large Language Models
by: Li, Yi-Chen, et al.
Published: (2025)
by: Li, Yi-Chen, et al.
Published: (2025)
Adaptive Pre-training Data Detection for Large Language Models via Surprising Tokens
by: Zhang, Anqi, et al.
Published: (2024)
by: Zhang, Anqi, et al.
Published: (2024)
Knowledge-augmented Pre-trained Language Models for Biomedical Relation Extraction
by: Sänger, Mario, et al.
Published: (2025)
by: Sänger, Mario, et al.
Published: (2025)
The Inverse Scaling Effect of Pre-Trained Language Model Surprisal Is Not Due to Data Leakage
by: Oh, Byung-Doh, et al.
Published: (2025)
by: Oh, Byung-Doh, et al.
Published: (2025)
Are Transformers in Pre-trained LM A Good ASR Encoder? An Empirical Study
by: An, Keyu, et al.
Published: (2024)
by: An, Keyu, et al.
Published: (2024)
Aptamer Encapsulated Inside the Array Channel of Ni‐MOF for Bisphenol A Determination in Multi‐interference System
by: Xiaokuan Zhang, et al.
Published: (2024)
by: Xiaokuan Zhang, et al.
Published: (2024)
A Systematic Study of Training-Free Methods for Trustworthy Large Language Models
by: Si, Wai Man, et al.
Published: (2026)
by: Si, Wai Man, et al.
Published: (2026)
DataMan: Data Manager for Pre-training Large Language Models
by: Peng, Ru, et al.
Published: (2025)
by: Peng, Ru, et al.
Published: (2025)
DELTA: Pre-train a Discriminative Encoder for Legal Case Retrieval via Structural Word Alignment
by: Li, Haitao, et al.
Published: (2024)
by: Li, Haitao, et al.
Published: (2024)
Boosting Explainability through Selective Rationalization in Pre-trained Language Models
by: Yuan, Libing, et al.
Published: (2025)
by: Yuan, Libing, et al.
Published: (2025)
RegMix: Data Mixture as Regression for Language Model Pre-training
by: Liu, Qian, et al.
Published: (2024)
by: Liu, Qian, et al.
Published: (2024)
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
by: Wang, Sudong, et al.
Published: (2026)
by: Wang, Sudong, et al.
Published: (2026)
SSL-WM: A Black-Box Watermarking Approach for Encoders Pre-trained by Self-supervised Learning
by: Lv, Peizhuo, et al.
Published: (2022)
by: Lv, Peizhuo, et al.
Published: (2022)
PDR: A Plug-and-Play Positional Decay Framework for LLM Pre-training Data Detection
by: Liu, Jinhan, et al.
Published: (2026)
by: Liu, Jinhan, et al.
Published: (2026)
DataVisT5: A Pre-trained Language Model for Jointly Understanding Text and Data Visualization
by: Wan, Zhuoyue, et al.
Published: (2024)
by: Wan, Zhuoyue, et al.
Published: (2024)
Quantifying Memorization and Detecting Training Data of Pre-trained Language Models using Japanese Newspaper
by: Ishihara, Shotaro, et al.
Published: (2024)
by: Ishihara, Shotaro, et al.
Published: (2024)
Improving Audio-Visual Speech Recognition by Lip-Subword Correlation Based Visual Pre-training and Cross-Modal Fusion Encoder
by: Dai, Yusheng, et al.
Published: (2023)
by: Dai, Yusheng, et al.
Published: (2023)
Language Models as Hierarchy Encoders
by: He, Yuan, et al.
Published: (2024)
by: He, Yuan, et al.
Published: (2024)
Fuzzy Fingerprinting Encoder Pre-trained Language Models for Emotion Recognition in Conversations: Human Assessment and Validity Study
by: Pereira, Patrícia, et al.
Published: (2026)
by: Pereira, Patrícia, et al.
Published: (2026)
SOS! Soft Prompt Attack Against Open-Source Large Language Models
by: Yang, Ziqing, et al.
Published: (2024)
by: Yang, Ziqing, et al.
Published: (2024)
Similar Items
-
Jailbreaking Attacks vs. Content Safety Filters: How Far Are We in the LLM Safety Arms Race?
by: Xin, Yuan, et al.
Published: (2025) -
Provably Cost-Sensitive Adversarial Defense via Randomized Smoothing
by: Xin, Yuan, et al.
Published: (2023) -
PoLLMgraph: Unraveling Hallucinations in Large Language Models via State Transition Dynamics
by: Zhu, Derui, et al.
Published: (2024) -
Reconsidering Degeneration of Token Embeddings with Definitions for Encoder-based Pre-trained Language Models
by: Zhang, Ying, et al.
Published: (2024) -
Probing Language Models for Pre-training Data Detection
by: Liu, Zhenhua, et al.
Published: (2024)