Privacy-preserved LLM Cascade via CoT-enhanced Policy Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Kai, Wang, Congchao, Peng, Liqian, Go, Alec, Liu, Xiaozhong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cascade-Aware Training of Language Models
par: Wang, Congchao, et autres
Publié: (2024)
par: Wang, Congchao, et autres
Publié: (2024)
Think Deep, Not Just Long: Measuring LLM Reasoning Effort via Deep-Thinking Tokens
par: Chen, Wei-Lin, et autres
Publié: (2026)
par: Chen, Wei-Lin, et autres
Publié: (2026)
Personalized LLM Response Generation with Parameterized Memory Injection
par: Zhang, Kai, et autres
Publié: (2024)
par: Zhang, Kai, et autres
Publié: (2024)
Syzygy of Thoughts: Improving LLM CoT with the Minimal Free Resolution
par: Li, Chenghao, et autres
Publié: (2025)
par: Li, Chenghao, et autres
Publié: (2025)
Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoning
par: Jin, Senjie, et autres
Publié: (2025)
par: Jin, Senjie, et autres
Publié: (2025)
From Explicit CoT to Implicit CoT: Learning to Internalize CoT Step by Step
par: Deng, Yuntian, et autres
Publié: (2024)
par: Deng, Yuntian, et autres
Publié: (2024)
You Only Fine-tune Once: Many-Shot In-Context Fine-Tuning for Large Language Models
par: He, Wenchong, et autres
Publié: (2025)
par: He, Wenchong, et autres
Publié: (2025)
AS-ES Learning: Towards Efficient CoT Learning in Small Models
par: Xi, Nuwa, et autres
Publié: (2024)
par: Xi, Nuwa, et autres
Publié: (2024)
CoT-based Synthesizer: Enhancing LLM Performance through Answer Synthesis
par: Zhang, Bohan, et autres
Publié: (2025)
par: Zhang, Bohan, et autres
Publié: (2025)
LLM-based Medical Assistant Personalization with Short- and Long-Term Memory Coordination
par: Zhang, Kai, et autres
Publié: (2023)
par: Zhang, Kai, et autres
Publié: (2023)
ERA-CoT: Improving Chain-of-Thought through Entity Relationship Analysis
par: Liu, Yanming, et autres
Publié: (2024)
par: Liu, Yanming, et autres
Publié: (2024)
Improve Student's Reasoning Generalizability through Cascading Decomposed CoTs Distillation
par: Dai, Chengwei, et autres
Publié: (2024)
par: Dai, Chengwei, et autres
Publié: (2024)
Can We Trust a Black-box LLM? LLM Untrustworthy Boundary Detection via Bias-Diffusion and Multi-Agent Reinforcement Learning
par: Zhou, Xiaotian, et autres
Publié: (2026)
par: Zhou, Xiaotian, et autres
Publié: (2026)
Universal Model Routing for Efficient LLM Inference
par: Jitkrittum, Wittawat, et autres
Publié: (2025)
par: Jitkrittum, Wittawat, et autres
Publié: (2025)
Investigating CoT Monitorability in Large Reasoning Models
par: Yang, Shu, et autres
Publié: (2025)
par: Yang, Shu, et autres
Publié: (2025)
The Curse of CoT: On the Limitations of Chain-of-Thought in In-Context Learning
par: Zheng, Tianshi, et autres
Publié: (2025)
par: Zheng, Tianshi, et autres
Publié: (2025)
Chain-of-Probe: Examining the Necessity and Accuracy of CoT Step-by-Step
par: Wang, Zezhong, et autres
Publié: (2024)
par: Wang, Zezhong, et autres
Publié: (2024)
CoT-Space: A Theoretical Framework for Internal Slow-Thinking via Reinforcement Learning
par: Gan, Zeyu, et autres
Publié: (2025)
par: Gan, Zeyu, et autres
Publié: (2025)
Towards Safety Reasoning in LLMs: AI-agentic Deliberation for Policy-embedded CoT Data Creation
par: Kumarage, Tharindu, et autres
Publié: (2025)
par: Kumarage, Tharindu, et autres
Publié: (2025)
Investigating Mysteries of CoT-Augmented Distillation
par: Wadhwa, Somin, et autres
Publié: (2024)
par: Wadhwa, Somin, et autres
Publié: (2024)
To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning
par: Sprague, Zayne, et autres
Publié: (2024)
par: Sprague, Zayne, et autres
Publié: (2024)
SIM-CoT: Supervised Implicit Chain-of-Thought
par: Wei, Xilin, et autres
Publié: (2025)
par: Wei, Xilin, et autres
Publié: (2025)
CoT Vectors: Transferring and Probing the Reasoning Mechanisms of LLMs
par: Li, Li, et autres
Publié: (2025)
par: Li, Li, et autres
Publié: (2025)
Distribution-Aligned Sequence Distillation for Superior Long-CoT Reasoning
par: Yan, Shaotian, et autres
Publié: (2026)
par: Yan, Shaotian, et autres
Publié: (2026)
The CoT Encyclopedia: Analyzing, Predicting, and Controlling how a Reasoning Model will Think
par: Lee, Seongyun, et autres
Publié: (2025)
par: Lee, Seongyun, et autres
Publié: (2025)
Efficient Long CoT Reasoning in Small Language Models
par: Wang, Zhaoyang, et autres
Publié: (2025)
par: Wang, Zhaoyang, et autres
Publié: (2025)
Knowledge-Infused Legal Wisdom: Navigating LLM Consultation through the Lens of Diagnostics and Positive-Unlabeled Reinforcement Learning
par: Wu, Yang, et autres
Publié: (2024)
par: Wu, Yang, et autres
Publié: (2024)
Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning
par: Li, Ang, et autres
Publié: (2025)
par: Li, Ang, et autres
Publié: (2025)
Mol-R1: Towards Explicit Long-CoT Reasoning in Molecule Discovery
par: Li, Jiatong, et autres
Publié: (2025)
par: Li, Jiatong, et autres
Publié: (2025)
MiCoTA: Bridging the Learnability Gap with Intermediate CoT and Teacher Assistants
par: Ding, Dongyi, et autres
Publié: (2025)
par: Ding, Dongyi, et autres
Publié: (2025)
Nash CoT: Multi-Path Inference with Preference Equilibrium
par: Zhang, Ziqi, et autres
Publié: (2024)
par: Zhang, Ziqi, et autres
Publié: (2024)
CoT-Evo: Evolutionary Distillation of Chain-of-Thought for Scientific Reasoning
par: Feng, Kehua, et autres
Publié: (2025)
par: Feng, Kehua, et autres
Publié: (2025)
Instruction Tuning and CoT Prompting for Contextual Medical QA with LLMs
par: Le, Chenqian, et autres
Publié: (2025)
par: Le, Chenqian, et autres
Publié: (2025)
Ada-R1: Hybrid-CoT via Bi-Level Adaptive Reasoning Optimization
par: Luo, Haotian, et autres
Publié: (2025)
par: Luo, Haotian, et autres
Publié: (2025)
Confidential Prompting: Privacy-preserving LLM Inference on Cloud
par: Li, Caihua, et autres
Publié: (2024)
par: Li, Caihua, et autres
Publié: (2024)
D-SCoRE: Document-Centric Segmentation and CoT Reasoning with Structured Export for QA-CoT Data Generation
par: Zhou, Weibo, et autres
Publié: (2025)
par: Zhou, Weibo, et autres
Publié: (2025)
Critic-CoT: Boosting the reasoning abilities of large language model via Chain-of-thoughts Critic
par: Zheng, Xin, et autres
Publié: (2024)
par: Zheng, Xin, et autres
Publié: (2024)
CoT is Not the Chain of Truth: An Empirical Internal Analysis of Reasoning LLMs for Fake News Generation
par: Tong, Zhao, et autres
Publié: (2026)
par: Tong, Zhao, et autres
Publié: (2026)
Generating Effective CoT Traces for Mitigating Causal Hallucination
par: Zhao, Yiheng, et autres
Publié: (2026)
par: Zhao, Yiheng, et autres
Publié: (2026)
Beyond Isolated Capabilities: Bridging Long CoT Reasoning and Long-Context Understanding
par: Wang, Yifei
Publié: (2025)
par: Wang, Yifei
Publié: (2025)
Documents similaires
-
Cascade-Aware Training of Language Models
par: Wang, Congchao, et autres
Publié: (2024) -
Think Deep, Not Just Long: Measuring LLM Reasoning Effort via Deep-Thinking Tokens
par: Chen, Wei-Lin, et autres
Publié: (2026) -
Personalized LLM Response Generation with Parameterized Memory Injection
par: Zhang, Kai, et autres
Publié: (2024) -
Syzygy of Thoughts: Improving LLM CoT with the Minimal Free Resolution
par: Li, Chenghao, et autres
Publié: (2025) -
Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoning
par: Jin, Senjie, et autres
Publié: (2025)