From Thinking to Output: Chain-of-Thought and Text Generation Characteristics in Reasoning Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Junhao, Xu, Zhenhao, Fang, Yuxin, Chen, Yichuan, Ying, Zuobin, Chang, Wenhan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Safety Context Injection: Inference-Time Safety Alignment via Static Filtering and Agentic Analysis
di: Xu, Zhenhao, et al.
Pubblicazione: (2026)
di: Xu, Zhenhao, et al.
Pubblicazione: (2026)
Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor
di: Chang, Wenhan, et al.
Pubblicazione: (2026)
di: Chang, Wenhan, et al.
Pubblicazione: (2026)
Preemptive Answer "Attacks" on Chain-of-Thought Reasoning
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
BadThink: Triggered Overthinking Attacks on Chain-of-Thought Reasoning in Large Language Models
di: Liu, Shuaitong, et al.
Pubblicazione: (2025)
di: Liu, Shuaitong, et al.
Pubblicazione: (2025)
Chain-of-Lure: A Universal Jailbreak Attack Framework using Unconstrained Synthetic Narratives
di: Chang, Wenhan, et al.
Pubblicazione: (2025)
di: Chang, Wenhan, et al.
Pubblicazione: (2025)
Autonomous Chain-of-Thought Distillation for Graph-Based Fraud Detection
di: Li, Yuan, et al.
Pubblicazione: (2026)
di: Li, Yuan, et al.
Pubblicazione: (2026)
SALT: Steering Activations towards Leakage-free Thinking in Chain of Thought
di: Batra, Shourya, et al.
Pubblicazione: (2025)
di: Batra, Shourya, et al.
Pubblicazione: (2025)
A Character-based Diffusion Embedding Algorithm for Enhancing the Generation Quality of Generative Linguistic Steganographic Texts
di: Chen, Yingquan, et al.
Pubblicazione: (2025)
di: Chen, Yingquan, et al.
Pubblicazione: (2025)
Chain-of-Code Collapse: Reasoning Failures in LLMs via Adversarial Prompting in Code Generation
di: Roh, Jaechul, et al.
Pubblicazione: (2025)
di: Roh, Jaechul, et al.
Pubblicazione: (2025)
CoTGuard: Using Chain-of-Thought Triggering for Copyright Protection in Multi-Agent LLM Systems
di: Wen, Yan, et al.
Pubblicazione: (2025)
di: Wen, Yan, et al.
Pubblicazione: (2025)
Leaky Thoughts: Large Reasoning Models Are Not Private Thinkers
di: Green, Tommaso, et al.
Pubblicazione: (2025)
di: Green, Tommaso, et al.
Pubblicazione: (2025)
GenBreak: Red Teaming Text-to-Image Generators Using Large Language Models
di: Wang, Zilong, et al.
Pubblicazione: (2025)
di: Wang, Zilong, et al.
Pubblicazione: (2025)
From Trade-off to Synergy: A Versatile Symbiotic Watermarking Framework for Large Language Models
di: Wang, Yidan, et al.
Pubblicazione: (2025)
di: Wang, Yidan, et al.
Pubblicazione: (2025)
R-CoT: A Reasoning-Layer Watermark via Redundant Chain-of-Thought in Large Language Models
di: Zhang, Ziming, et al.
Pubblicazione: (2026)
di: Zhang, Ziming, et al.
Pubblicazione: (2026)
Bileve: Securing Text Provenance in Large Language Models Against Spoofing with Bi-level Signature
di: Zhou, Tong, et al.
Pubblicazione: (2024)
di: Zhou, Tong, et al.
Pubblicazione: (2024)
Reasoning-Oriented Programming: Chaining Semantic Gadgets to Jailbreak Large Vision Language Models
di: Zou, Quanchen, et al.
Pubblicazione: (2026)
di: Zou, Quanchen, et al.
Pubblicazione: (2026)
Chain-of-Thought Prompting of Large Language Models for Discovering and Fixing Software Vulnerabilities
di: Nong, Yu, et al.
Pubblicazione: (2024)
di: Nong, Yu, et al.
Pubblicazione: (2024)
Output Supervision Can Obfuscate the Chain of Thought
di: Drori, Jacob, et al.
Pubblicazione: (2025)
di: Drori, Jacob, et al.
Pubblicazione: (2025)
Thought-Transfer: Indirect Targeted Poisoning Attacks on Chain-of-Thought Reasoning Models
di: Chaudhari, Harsh, et al.
Pubblicazione: (2026)
di: Chaudhari, Harsh, et al.
Pubblicazione: (2026)
Beyond Text: Unveiling Privacy Vulnerabilities in Multi-modal Retrieval-Augmented Generation
di: Zhang, Jiankun, et al.
Pubblicazione: (2025)
di: Zhang, Jiankun, et al.
Pubblicazione: (2025)
Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2025)
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2025)
Lightweight Yet Secure: Secure Scripting Language Generation via Lightweight LLMs
di: Zhang, Keyang, et al.
Pubblicazione: (2026)
di: Zhang, Keyang, et al.
Pubblicazione: (2026)
Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models
di: Li, Haoran, et al.
Pubblicazione: (2024)
di: Li, Haoran, et al.
Pubblicazione: (2024)
LLM-based Privacy Data Augmentation Guided by Knowledge Distillation with a Distribution Tutor for Medical Text Classification
di: Song, Yiping, et al.
Pubblicazione: (2024)
di: Song, Yiping, et al.
Pubblicazione: (2024)
GuardReasoner-Omni: A Reasoning-based Multi-modal Guardrail for Text, Image, Video, and Audio
di: Zhu, Zhenhao, et al.
Pubblicazione: (2026)
di: Zhu, Zhenhao, et al.
Pubblicazione: (2026)
Text Embedding Inversion Security for Multilingual Language Models
di: Chen, Yiyi, et al.
Pubblicazione: (2024)
di: Chen, Yiyi, et al.
Pubblicazione: (2024)
Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations
di: Wei, Zeming, et al.
Pubblicazione: (2023)
di: Wei, Zeming, et al.
Pubblicazione: (2023)
Yet Another Watermark for Large Language Models
di: Bao, Siyuan, et al.
Pubblicazione: (2025)
di: Bao, Siyuan, et al.
Pubblicazione: (2025)
Can Reasoning Models Obfuscate Reasoning? Stress-Testing Chain-of-Thought Monitorability
di: Zolkowski, Artur, et al.
Pubblicazione: (2025)
di: Zolkowski, Artur, et al.
Pubblicazione: (2025)
A General Pseudonymization Framework for Cloud-Based LLMs: Replacing Privacy Information in Controlled Text Generation
di: Hou, Shilong, et al.
Pubblicazione: (2025)
di: Hou, Shilong, et al.
Pubblicazione: (2025)
GradEscape: A Gradient-Based Evader Against AI-Generated Text Detectors
di: Meng, Wenlong, et al.
Pubblicazione: (2025)
di: Meng, Wenlong, et al.
Pubblicazione: (2025)
ExplainableGuard: Interpretable Adversarial Defense for Large Language Models Using Chain-of-Thought Reasoning
di: Guan, Shaowei, et al.
Pubblicazione: (2025)
di: Guan, Shaowei, et al.
Pubblicazione: (2025)
Adversarial Text Generation with Dynamic Contextual Perturbation
di: Waghela, Hetvi, et al.
Pubblicazione: (2025)
di: Waghela, Hetvi, et al.
Pubblicazione: (2025)
BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models
di: Xiang, Zhen, et al.
Pubblicazione: (2024)
di: Xiang, Zhen, et al.
Pubblicazione: (2024)
StructuralSleight: Automated Jailbreak Attacks on Large Language Models Utilizing Uncommon Text-Organization Structures
di: Li, Bangxin, et al.
Pubblicazione: (2024)
di: Li, Bangxin, et al.
Pubblicazione: (2024)
DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
Time Will Tell: Timing Side Channels via Output Token Count in Large Language Models
di: Zhang, Tianchen, et al.
Pubblicazione: (2024)
di: Zhang, Tianchen, et al.
Pubblicazione: (2024)
BiAxisAudit: A Novel Framework to Evaluate LLM Bias Across Prompt Sensitivity and Response-Layer Divergence
di: Gan, Jialing, et al.
Pubblicazione: (2026)
di: Gan, Jialing, et al.
Pubblicazione: (2026)
The Surprising Universality of LLM Outputs: A Real-Time Verification Primitive
di: Bogdan, Alex, et al.
Pubblicazione: (2026)
di: Bogdan, Alex, et al.
Pubblicazione: (2026)
InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Large Language Model Agents
di: Zhan, Qiusi, et al.
Pubblicazione: (2024)
di: Zhan, Qiusi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Safety Context Injection: Inference-Time Safety Alignment via Static Filtering and Agentic Analysis
di: Xu, Zhenhao, et al.
Pubblicazione: (2026) -
Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor
di: Chang, Wenhan, et al.
Pubblicazione: (2026) -
Preemptive Answer "Attacks" on Chain-of-Thought Reasoning
di: Xu, Rongwu, et al.
Pubblicazione: (2024) -
BadThink: Triggered Overthinking Attacks on Chain-of-Thought Reasoning in Large Language Models
di: Liu, Shuaitong, et al.
Pubblicazione: (2025) -
Chain-of-Lure: A Universal Jailbreak Attack Framework using Unconstrained Synthetic Narratives
di: Chang, Wenhan, et al.
Pubblicazione: (2025)