How Do Latent Reasoning Methods Perform Under Weak and Strong Supervision?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cui, Yingqian, Dai, Zhenwei, He, Bing, Shi, Zhan, Liu, Hui, Sun, Rui, Liu, Zhiji, Xing, Yue, Tang, Jiliang, Dumoulin, Benoit |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
par: Cui, Yingqian, et autres
Publié: (2025)
par: Cui, Yingqian, et autres
Publié: (2025)
Towards the Effect of Examples on In-Context Learning: A Theoretical Case Study
par: He, Pengfei, et autres
Publié: (2024)
par: He, Pengfei, et autres
Publié: (2024)
TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use
par: He, Pengfei, et autres
Publié: (2025)
par: He, Pengfei, et autres
Publié: (2025)
Superiority of Multi-Head Attention in In-Context Linear Regression
par: Cui, Yingqian, et autres
Publié: (2024)
par: Cui, Yingqian, et autres
Publié: (2024)
Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Models
par: Cui, Yingqian, et autres
Publié: (2025)
par: Cui, Yingqian, et autres
Publié: (2025)
A Theoretical Understanding of Chain-of-Thought: Coherent Reasoning and Error-Aware Demonstration
par: Cui, Yingqian, et autres
Publié: (2024)
par: Cui, Yingqian, et autres
Publié: (2024)
Six-CD: Benchmarking Concept Removals for Benign Text-to-image Diffusion Models
par: Ren, Jie, et autres
Publié: (2024)
par: Ren, Jie, et autres
Publié: (2024)
DiffusionShield: A Watermark for Copyright Protection against Generative Diffusion Models
par: Cui, Yingqian, et autres
Publié: (2023)
par: Cui, Yingqian, et autres
Publié: (2023)
SoK: Machine Unlearning for Large Language Models
par: Ren, Jie, et autres
Publié: (2025)
par: Ren, Jie, et autres
Publié: (2025)
Weak-to-Strong Reasoning
par: Yang, Yuqing, et autres
Publié: (2024)
par: Yang, Yuqing, et autres
Publié: (2024)
Incentivizing Strong Reasoning from Weak Supervision
par: Yuan, Yige, et autres
Publié: (2025)
par: Yuan, Yige, et autres
Publié: (2025)
EnTruth: Enhancing the Traceability of Unauthorized Dataset Usage in Text-to-image Diffusion Models with Minimal and Robust Alterations
par: Ren, Jie, et autres
Publié: (2024)
par: Ren, Jie, et autres
Publié: (2024)
Examples as the Prompt: A Scalable Approach for Efficient LLM Adaptation in E-Commerce
par: Zeng, Jingying, et autres
Publié: (2025)
par: Zeng, Jingying, et autres
Publié: (2025)
FT-Shield: A Watermark Against Unauthorized Fine-tuning in Text-to-Image Diffusion Models
par: Cui, Yingqian, et autres
Publié: (2023)
par: Cui, Yingqian, et autres
Publié: (2023)
Position: Agentic Evolution is the Path to Evolving LLMs
par: Lin, Minhua, et autres
Publié: (2026)
par: Lin, Minhua, et autres
Publié: (2026)
Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs
par: Liu, Zhining, et autres
Publié: (2025)
par: Liu, Zhining, et autres
Publié: (2025)
Sharpness-Aware Data Poisoning Attack
par: He, Pengfei, et autres
Publié: (2023)
par: He, Pengfei, et autres
Publié: (2023)
Image-Feature Weak-to-Strong Consistency: An Enhanced Paradigm for Semi-Supervised Learning
par: Wu, Zhiyu, et autres
Publié: (2024)
par: Wu, Zhiyu, et autres
Publié: (2024)
Weak to Strong: VLM-Based Pseudo-Labeling as a Weakly Supervised Training Strategy in Multimodal Video-based Hidden Emotion Understanding Tasks
par: Wang, Yufei, et autres
Publié: (2026)
par: Wang, Yufei, et autres
Publié: (2026)
CloudMatch: Weak-to-Strong Consistency Learning for Semi-Supervised Cloud Detection
par: Zhao, Jiayi, et autres
Publié: (2026)
par: Zhao, Jiayi, et autres
Publié: (2026)
A Robust Semantics-based Watermark for Large Language Model against Paraphrasing
par: Ren, Jie, et autres
Publié: (2023)
par: Ren, Jie, et autres
Publié: (2023)
Retrieval Heads are Dynamic
par: Lin, Yuping, et autres
Publié: (2026)
par: Lin, Yuping, et autres
Publié: (2026)
Stealthy Backdoor Attack via Confidence-driven Sampling
par: He, Pengfei, et autres
Publié: (2023)
par: He, Pengfei, et autres
Publié: (2023)
Co-Supervised Learning: Improving Weak-to-Strong Generalization with Hierarchical Mixture of Experts
par: Liu, Yuejiang, et autres
Publié: (2024)
par: Liu, Yuejiang, et autres
Publié: (2024)
Evaluating Baseline Correction in Raman Spectroscopy: A Novel Cross‐Wavelength Correlation Approach for Low‐Maturity Organic Matter
par: Zhiji Ou, et autres
Publié: (2025)
par: Zhiji Ou, et autres
Publié: (2025)
Crafting Reversible SFT Behaviors in Large Language Models
par: Lin, Yuping, et autres
Publié: (2026)
par: Lin, Yuping, et autres
Publié: (2026)
Faster Accelerated First-order Methods for Convex Optimization with Strongly Convex Function Constraints
par: Lin, Zhenwei, et autres
Publié: (2022)
par: Lin, Zhenwei, et autres
Publié: (2022)
Weakly Supervised 3D Open-vocabulary Segmentation
par: Liu, Kunhao, et autres
Publié: (2023)
par: Liu, Kunhao, et autres
Publié: (2023)
Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model
par: Zhu, Wenhong, et autres
Publié: (2024)
par: Zhu, Wenhong, et autres
Publié: (2024)
How Well Do Self-Supervised Methods Perform in Cross-Domain Few-Shot Learning?
par: Zhang, Yiyi, et autres
Publié: (2022)
par: Zhang, Yiyi, et autres
Publié: (2022)
Weak-Driven Learning: How Weak Agents make Strong Agents Stronger
par: Chen, Zehao, et autres
Publié: (2026)
par: Chen, Zehao, et autres
Publié: (2026)
The Alignment Floor: How Persona Customization Breaks Safety in Weakly-Aligned LLMs
par: Zhang, Xing, et autres
Publié: (2026)
par: Zhang, Xing, et autres
Publié: (2026)
Weak synchronization in heterogeneous multi-agent systems
par: Stoorvogel, Anton A., et autres
Publié: (2024)
par: Stoorvogel, Anton A., et autres
Publié: (2024)
To trust or not to trust: Attention-based Trust Management for LLM Multi-Agent Systems
par: He, Pengfei, et autres
Publié: (2025)
par: He, Pengfei, et autres
Publié: (2025)
Data Poisoning for In-context Learning
par: He, Pengfei, et autres
Publié: (2024)
par: He, Pengfei, et autres
Publié: (2024)
Bronchovascular Tree-Guided Weakly Supervised Learning Method for Pulmonary Segment Segmentation
par: Zhao, Ruijie, et autres
Publié: (2025)
par: Zhao, Ruijie, et autres
Publié: (2025)
Disentangling Latent Shifts of In-Context Learning with Weak Supervision
par: Jukić, Josip, et autres
Publié: (2024)
par: Jukić, Josip, et autres
Publié: (2024)
On Learning Latent Models with Multi-Instance Weak Supervision
par: Wang, Kaifu, et autres
Publié: (2023)
par: Wang, Kaifu, et autres
Publié: (2023)
Do Large Language Models Latently Perform Multi-Hop Reasoning?
par: Yang, Sohee, et autres
Publié: (2024)
par: Yang, Sohee, et autres
Publié: (2024)
Weak-to-Strong Generalization beyond Accuracy: a Pilot Study in Safety, Toxicity, and Legal Reasoning
par: Ye, Ruimeng, et autres
Publié: (2024)
par: Ye, Ruimeng, et autres
Publié: (2024)
Documents similaires
-
Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
par: Cui, Yingqian, et autres
Publié: (2025) -
Towards the Effect of Examples on In-Context Learning: A Theoretical Case Study
par: He, Pengfei, et autres
Publié: (2024) -
TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use
par: He, Pengfei, et autres
Publié: (2025) -
Superiority of Multi-Head Attention in In-Context Linear Regression
par: Cui, Yingqian, et autres
Publié: (2024) -
Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Models
par: Cui, Yingqian, et autres
Publié: (2025)