How Do Latent Reasoning Methods Perform Under Weak and Strong Supervision?
Fuente:
arXiv
Salvato in:
| Autori principali: | Cui, Yingqian, Dai, Zhenwei, He, Bing, Shi, Zhan, Liu, Hui, Sun, Rui, Liu, Zhiji, Xing, Yue, Tang, Jiliang, Dumoulin, Benoit |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
di: Cui, Yingqian, et al.
Pubblicazione: (2025)
di: Cui, Yingqian, et al.
Pubblicazione: (2025)
Towards the Effect of Examples on In-Context Learning: A Theoretical Case Study
di: He, Pengfei, et al.
Pubblicazione: (2024)
di: He, Pengfei, et al.
Pubblicazione: (2024)
TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use
di: He, Pengfei, et al.
Pubblicazione: (2025)
di: He, Pengfei, et al.
Pubblicazione: (2025)
Superiority of Multi-Head Attention in In-Context Linear Regression
di: Cui, Yingqian, et al.
Pubblicazione: (2024)
di: Cui, Yingqian, et al.
Pubblicazione: (2024)
Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Models
di: Cui, Yingqian, et al.
Pubblicazione: (2025)
di: Cui, Yingqian, et al.
Pubblicazione: (2025)
A Theoretical Understanding of Chain-of-Thought: Coherent Reasoning and Error-Aware Demonstration
di: Cui, Yingqian, et al.
Pubblicazione: (2024)
di: Cui, Yingqian, et al.
Pubblicazione: (2024)
Six-CD: Benchmarking Concept Removals for Benign Text-to-image Diffusion Models
di: Ren, Jie, et al.
Pubblicazione: (2024)
di: Ren, Jie, et al.
Pubblicazione: (2024)
DiffusionShield: A Watermark for Copyright Protection against Generative Diffusion Models
di: Cui, Yingqian, et al.
Pubblicazione: (2023)
di: Cui, Yingqian, et al.
Pubblicazione: (2023)
SoK: Machine Unlearning for Large Language Models
di: Ren, Jie, et al.
Pubblicazione: (2025)
di: Ren, Jie, et al.
Pubblicazione: (2025)
Weak-to-Strong Reasoning
di: Yang, Yuqing, et al.
Pubblicazione: (2024)
di: Yang, Yuqing, et al.
Pubblicazione: (2024)
Incentivizing Strong Reasoning from Weak Supervision
di: Yuan, Yige, et al.
Pubblicazione: (2025)
di: Yuan, Yige, et al.
Pubblicazione: (2025)
EnTruth: Enhancing the Traceability of Unauthorized Dataset Usage in Text-to-image Diffusion Models with Minimal and Robust Alterations
di: Ren, Jie, et al.
Pubblicazione: (2024)
di: Ren, Jie, et al.
Pubblicazione: (2024)
Examples as the Prompt: A Scalable Approach for Efficient LLM Adaptation in E-Commerce
di: Zeng, Jingying, et al.
Pubblicazione: (2025)
di: Zeng, Jingying, et al.
Pubblicazione: (2025)
FT-Shield: A Watermark Against Unauthorized Fine-tuning in Text-to-Image Diffusion Models
di: Cui, Yingqian, et al.
Pubblicazione: (2023)
di: Cui, Yingqian, et al.
Pubblicazione: (2023)
Position: Agentic Evolution is the Path to Evolving LLMs
di: Lin, Minhua, et al.
Pubblicazione: (2026)
di: Lin, Minhua, et al.
Pubblicazione: (2026)
Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs
di: Liu, Zhining, et al.
Pubblicazione: (2025)
di: Liu, Zhining, et al.
Pubblicazione: (2025)
Sharpness-Aware Data Poisoning Attack
di: He, Pengfei, et al.
Pubblicazione: (2023)
di: He, Pengfei, et al.
Pubblicazione: (2023)
Image-Feature Weak-to-Strong Consistency: An Enhanced Paradigm for Semi-Supervised Learning
di: Wu, Zhiyu, et al.
Pubblicazione: (2024)
di: Wu, Zhiyu, et al.
Pubblicazione: (2024)
Weak to Strong: VLM-Based Pseudo-Labeling as a Weakly Supervised Training Strategy in Multimodal Video-based Hidden Emotion Understanding Tasks
di: Wang, Yufei, et al.
Pubblicazione: (2026)
di: Wang, Yufei, et al.
Pubblicazione: (2026)
CloudMatch: Weak-to-Strong Consistency Learning for Semi-Supervised Cloud Detection
di: Zhao, Jiayi, et al.
Pubblicazione: (2026)
di: Zhao, Jiayi, et al.
Pubblicazione: (2026)
A Robust Semantics-based Watermark for Large Language Model against Paraphrasing
di: Ren, Jie, et al.
Pubblicazione: (2023)
di: Ren, Jie, et al.
Pubblicazione: (2023)
Retrieval Heads are Dynamic
di: Lin, Yuping, et al.
Pubblicazione: (2026)
di: Lin, Yuping, et al.
Pubblicazione: (2026)
Stealthy Backdoor Attack via Confidence-driven Sampling
di: He, Pengfei, et al.
Pubblicazione: (2023)
di: He, Pengfei, et al.
Pubblicazione: (2023)
Co-Supervised Learning: Improving Weak-to-Strong Generalization with Hierarchical Mixture of Experts
di: Liu, Yuejiang, et al.
Pubblicazione: (2024)
di: Liu, Yuejiang, et al.
Pubblicazione: (2024)
Evaluating Baseline Correction in Raman Spectroscopy: A Novel Cross‐Wavelength Correlation Approach for Low‐Maturity Organic Matter
di: Zhiji Ou, et al.
Pubblicazione: (2025)
di: Zhiji Ou, et al.
Pubblicazione: (2025)
Crafting Reversible SFT Behaviors in Large Language Models
di: Lin, Yuping, et al.
Pubblicazione: (2026)
di: Lin, Yuping, et al.
Pubblicazione: (2026)
Faster Accelerated First-order Methods for Convex Optimization with Strongly Convex Function Constraints
di: Lin, Zhenwei, et al.
Pubblicazione: (2022)
di: Lin, Zhenwei, et al.
Pubblicazione: (2022)
Weakly Supervised 3D Open-vocabulary Segmentation
di: Liu, Kunhao, et al.
Pubblicazione: (2023)
di: Liu, Kunhao, et al.
Pubblicazione: (2023)
Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model
di: Zhu, Wenhong, et al.
Pubblicazione: (2024)
di: Zhu, Wenhong, et al.
Pubblicazione: (2024)
How Well Do Self-Supervised Methods Perform in Cross-Domain Few-Shot Learning?
di: Zhang, Yiyi, et al.
Pubblicazione: (2022)
di: Zhang, Yiyi, et al.
Pubblicazione: (2022)
Weak-Driven Learning: How Weak Agents make Strong Agents Stronger
di: Chen, Zehao, et al.
Pubblicazione: (2026)
di: Chen, Zehao, et al.
Pubblicazione: (2026)
The Alignment Floor: How Persona Customization Breaks Safety in Weakly-Aligned LLMs
di: Zhang, Xing, et al.
Pubblicazione: (2026)
di: Zhang, Xing, et al.
Pubblicazione: (2026)
Weak synchronization in heterogeneous multi-agent systems
di: Stoorvogel, Anton A., et al.
Pubblicazione: (2024)
di: Stoorvogel, Anton A., et al.
Pubblicazione: (2024)
To trust or not to trust: Attention-based Trust Management for LLM Multi-Agent Systems
di: He, Pengfei, et al.
Pubblicazione: (2025)
di: He, Pengfei, et al.
Pubblicazione: (2025)
Data Poisoning for In-context Learning
di: He, Pengfei, et al.
Pubblicazione: (2024)
di: He, Pengfei, et al.
Pubblicazione: (2024)
Bronchovascular Tree-Guided Weakly Supervised Learning Method for Pulmonary Segment Segmentation
di: Zhao, Ruijie, et al.
Pubblicazione: (2025)
di: Zhao, Ruijie, et al.
Pubblicazione: (2025)
Disentangling Latent Shifts of In-Context Learning with Weak Supervision
di: Jukić, Josip, et al.
Pubblicazione: (2024)
di: Jukić, Josip, et al.
Pubblicazione: (2024)
On Learning Latent Models with Multi-Instance Weak Supervision
di: Wang, Kaifu, et al.
Pubblicazione: (2023)
di: Wang, Kaifu, et al.
Pubblicazione: (2023)
Do Large Language Models Latently Perform Multi-Hop Reasoning?
di: Yang, Sohee, et al.
Pubblicazione: (2024)
di: Yang, Sohee, et al.
Pubblicazione: (2024)
Weak-to-Strong Generalization beyond Accuracy: a Pilot Study in Safety, Toxicity, and Legal Reasoning
di: Ye, Ruimeng, et al.
Pubblicazione: (2024)
di: Ye, Ruimeng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
di: Cui, Yingqian, et al.
Pubblicazione: (2025) -
Towards the Effect of Examples on In-Context Learning: A Theoretical Case Study
di: He, Pengfei, et al.
Pubblicazione: (2024) -
TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use
di: He, Pengfei, et al.
Pubblicazione: (2025) -
Superiority of Multi-Head Attention in In-Context Linear Regression
di: Cui, Yingqian, et al.
Pubblicazione: (2024) -
Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Models
di: Cui, Yingqian, et al.
Pubblicazione: (2025)