Language Models Optimized to Fool Detectors Still Have a Distinct Style (And How to Change It)
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Soto, Rafael Rivera, Chen, Barry, Andrews, Nicholas |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Mitigating Paraphrase Attacks on Machine-Text Detectors via Paraphrase Inversion
von: Soto, Rafael Rivera, et al.
Veröffentlicht: (2024)
von: Soto, Rafael Rivera, et al.
Veröffentlicht: (2024)
Too Big to Fool: Resisting Deception in Language Models
von: Samsami, Mohammad Reza, et al.
Veröffentlicht: (2024)
von: Samsami, Mohammad Reza, et al.
Veröffentlicht: (2024)
Few-Shot Detection of Machine-Generated Text using Style Representations
von: Soto, Rafael Rivera, et al.
Veröffentlicht: (2024)
von: Soto, Rafael Rivera, et al.
Veröffentlicht: (2024)
Stress-testing Machine Generated Text Detection: Shifting Language Models Writing Style to Fool Detectors
von: Pedrotti, Andrea, et al.
Veröffentlicht: (2025)
von: Pedrotti, Andrea, et al.
Veröffentlicht: (2025)
Still "Talking About Large Language Models": Some Clarifications
von: Shanahan, Murray
Veröffentlicht: (2024)
von: Shanahan, Murray
Veröffentlicht: (2024)
Can Large Language Models Still Explain Themselves? Investigating the Impact of Quantization on Self-Explanations
von: Wang, Qianli, et al.
Veröffentlicht: (2026)
von: Wang, Qianli, et al.
Veröffentlicht: (2026)
Aioli: A Unified Optimization Framework for Language Model Data Mixing
von: Chen, Mayee F., et al.
Veröffentlicht: (2024)
von: Chen, Mayee F., et al.
Veröffentlicht: (2024)
SequentialBreak: Large Language Models Can be Fooled by Embedding Jailbreak Prompts into Sequential Prompt Chains
von: Saiem, Bijoy Ahmed, et al.
Veröffentlicht: (2024)
von: Saiem, Bijoy Ahmed, et al.
Veröffentlicht: (2024)
StyleBench: Evaluating thinking styles in Large Language Models
von: Guo, Junyu, et al.
Veröffentlicht: (2025)
von: Guo, Junyu, et al.
Veröffentlicht: (2025)
Do Large Language Models Have Compositional Ability? An Investigation into Limitations and Scalability
von: Xu, Zhuoyan, et al.
Veröffentlicht: (2024)
von: Xu, Zhuoyan, et al.
Veröffentlicht: (2024)
Having Beer after Prayer? Measuring Cultural Bias in Large Language Models
von: Naous, Tarek, et al.
Veröffentlicht: (2023)
von: Naous, Tarek, et al.
Veröffentlicht: (2023)
TACO: Adversarial Camouflage Optimization on Trucks to Fool Object Detectors
von: Dimitriu, Adonisz, et al.
Veröffentlicht: (2024)
von: Dimitriu, Adonisz, et al.
Veröffentlicht: (2024)
Do Language Models Have Bayesian Brains? Distinguishing Stochastic and Deterministic Decision Patterns within Large Language Models
von: Cui, Andrea Yaoyun, et al.
Veröffentlicht: (2025)
von: Cui, Andrea Yaoyun, et al.
Veröffentlicht: (2025)
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
von: Rafailov, Rafael, et al.
Veröffentlicht: (2023)
von: Rafailov, Rafael, et al.
Veröffentlicht: (2023)
Evaluating Gender Bias Transfer between Pre-trained and Prompt-Adapted Language Models
von: Mackraz, Natalie, et al.
Veröffentlicht: (2024)
von: Mackraz, Natalie, et al.
Veröffentlicht: (2024)
Your Finetuned Large Language Model is Already a Powerful Out-of-distribution Detector
von: Zhang, Andi, et al.
Veröffentlicht: (2024)
von: Zhang, Andi, et al.
Veröffentlicht: (2024)
Small Models Are (Still) Effective Cross-Domain Argument Extractors
von: Gantt, William, et al.
Veröffentlicht: (2024)
von: Gantt, William, et al.
Veröffentlicht: (2024)
What is it for a Machine Learning Model to Have a Capability?
von: Harding, Jacqueline, et al.
Veröffentlicht: (2024)
von: Harding, Jacqueline, et al.
Veröffentlicht: (2024)
A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos
von: Yao, Yang, et al.
Veröffentlicht: (2025)
von: Yao, Yang, et al.
Veröffentlicht: (2025)
Kakugo: Distillation of Low-Resource Languages into Small Language Models
von: Devine, Peter, et al.
Veröffentlicht: (2026)
von: Devine, Peter, et al.
Veröffentlicht: (2026)
Large Language Models as Optimizers
von: Yang, Chengrun, et al.
Veröffentlicht: (2023)
von: Yang, Chengrun, et al.
Veröffentlicht: (2023)
Prompt Optimization Via Diffusion Language Models
von: Wang, Shiyu, et al.
Veröffentlicht: (2026)
von: Wang, Shiyu, et al.
Veröffentlicht: (2026)
Frontier LLMs Still Struggle with Simple Reasoning Tasks
von: Malek, Alan, et al.
Veröffentlicht: (2025)
von: Malek, Alan, et al.
Veröffentlicht: (2025)
Base Models Look Human To AI Detectors
von: Xu, Yixuan Even, et al.
Veröffentlicht: (2026)
von: Xu, Yixuan Even, et al.
Veröffentlicht: (2026)
(How) Do Language Models Track State?
von: Li, Belinda Z., et al.
Veröffentlicht: (2025)
von: Li, Belinda Z., et al.
Veröffentlicht: (2025)
ELSA: A Style Aligned Dataset for Emotionally Intelligent Language Generation
von: Gandhi, Vishal, et al.
Veröffentlicht: (2025)
von: Gandhi, Vishal, et al.
Veröffentlicht: (2025)
AfroBench: How Good are Large Language Models on African Languages?
von: Ojo, Jessica, et al.
Veröffentlicht: (2023)
von: Ojo, Jessica, et al.
Veröffentlicht: (2023)
CORM: Cache Optimization with Recent Message for Large Language Model Inference
von: Dai, Jincheng, et al.
Veröffentlicht: (2024)
von: Dai, Jincheng, et al.
Veröffentlicht: (2024)
ROPO: Robust Preference Optimization for Large Language Models
von: Liang, Xize, et al.
Veröffentlicht: (2024)
von: Liang, Xize, et al.
Veröffentlicht: (2024)
How do Language Models Bind Entities in Context?
von: Feng, Jiahai, et al.
Veröffentlicht: (2023)
von: Feng, Jiahai, et al.
Veröffentlicht: (2023)
Capturing Sparks of Abstraction for the ARC Challenge
von: Andrews, Martin
Veröffentlicht: (2024)
von: Andrews, Martin
Veröffentlicht: (2024)
Steering into New Embedding Spaces: Analyzing Cross-Lingual Alignment Induced by Model Interventions in Multilingual Language Models
von: Sundar, Anirudh, et al.
Veröffentlicht: (2025)
von: Sundar, Anirudh, et al.
Veröffentlicht: (2025)
SLOT: Sample-specific Language Model Optimization at Test-time
von: Hu, Yang, et al.
Veröffentlicht: (2025)
von: Hu, Yang, et al.
Veröffentlicht: (2025)
How Bad is Training on Synthetic Data? A Statistical Analysis of Language Model Collapse
von: Seddik, Mohamed El Amine, et al.
Veröffentlicht: (2024)
von: Seddik, Mohamed El Amine, et al.
Veröffentlicht: (2024)
StyleRec: A Benchmark Dataset for Prompt Recovery in Writing Style Transformation
von: Liu, Shenyang, et al.
Veröffentlicht: (2025)
von: Liu, Shenyang, et al.
Veröffentlicht: (2025)
Do Large Language Models Know How Much They Know?
von: Prato, Gabriele, et al.
Veröffentlicht: (2025)
von: Prato, Gabriele, et al.
Veröffentlicht: (2025)
Unfamiliar Finetuning Examples Control How Language Models Hallucinate
von: Kang, Katie, et al.
Veröffentlicht: (2024)
von: Kang, Katie, et al.
Veröffentlicht: (2024)
How Important Is Tokenization in French Medical Masked Language Models?
von: Labrak, Yanis, et al.
Veröffentlicht: (2024)
von: Labrak, Yanis, et al.
Veröffentlicht: (2024)
When Should Models Change Their Minds? Contextual Belief Management in Large Language Models
von: Xu, Haoming, et al.
Veröffentlicht: (2026)
von: Xu, Haoming, et al.
Veröffentlicht: (2026)
RAFT: Realistic Attacks to Fool Text Detectors
von: Wang, James, et al.
Veröffentlicht: (2024)
von: Wang, James, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Mitigating Paraphrase Attacks on Machine-Text Detectors via Paraphrase Inversion
von: Soto, Rafael Rivera, et al.
Veröffentlicht: (2024) -
Too Big to Fool: Resisting Deception in Language Models
von: Samsami, Mohammad Reza, et al.
Veröffentlicht: (2024) -
Few-Shot Detection of Machine-Generated Text using Style Representations
von: Soto, Rafael Rivera, et al.
Veröffentlicht: (2024) -
Stress-testing Machine Generated Text Detection: Shifting Language Models Writing Style to Fool Detectors
von: Pedrotti, Andrea, et al.
Veröffentlicht: (2025) -
Still "Talking About Large Language Models": Some Clarifications
von: Shanahan, Murray
Veröffentlicht: (2024)