WIST: Web-Grounded Iterative Self-Play Tree for Domain-Targeted Reasoning Improvement
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Fangyuan, Li, Pengfei, Wang, Shijie, Gao, Junqi, Liu, Jianxing, Qi, Biqing, Li, Yuqiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
Enhancing Adversarial Transferability via Information Bottleneck Constraints
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
An Efficient Memory Module for Graph Few-Shot Class-Incremental Learning
di: Li, Dong, et al.
Pubblicazione: (2024)
di: Li, Dong, et al.
Pubblicazione: (2024)
Graph Counselor: Adaptive Graph Exploration via Multi-Agent Synergy to Enhance LLM Reasoning
di: Gao, Junqi, et al.
Pubblicazione: (2025)
di: Gao, Junqi, et al.
Pubblicazione: (2025)
Perturbation Towards Easy Samples Improves Targeted Adversarial Transferability
di: Gao, Junqi, et al.
Pubblicazione: (2024)
di: Gao, Junqi, et al.
Pubblicazione: (2024)
MARS$^2$: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation
di: Li, Pengfei, et al.
Pubblicazione: (2026)
di: Li, Pengfei, et al.
Pubblicazione: (2026)
Exploring Adversarial Robustness of Deep State Space Models
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
Contrastive Augmented Graph2Graph Memory Interaction for Few Shot Continual Learning
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
Investigating Deep Watermark Security: An Adversarial Transferability Perspective
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
SR-CIS: Self-Reflective Incremental System with Decoupled Memory and Reasoning
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
Leveraging Adaptive Group Negotiation for Heterogeneous Multi-Robot Collaboration with Large Language Models
di: Song, Siqi, et al.
Pubblicazione: (2025)
di: Song, Siqi, et al.
Pubblicazione: (2025)
Fast and Slow Gradient Approximation for Binary Neural Network Optimization
di: Chen, Xinquan, et al.
Pubblicazione: (2024)
di: Chen, Xinquan, et al.
Pubblicazione: (2024)
CrossLinear: Plug-and-Play Cross-Correlation Embedding for Time Series Forecasting with Exogenous Variables
di: Zhou, Pengfei, et al.
Pubblicazione: (2025)
di: Zhou, Pengfei, et al.
Pubblicazione: (2025)
Learning Robust Reasoning through Guided Adversarial Self-Play
di: Li, Shuozhe, et al.
Pubblicazione: (2026)
di: Li, Shuozhe, et al.
Pubblicazione: (2026)
T-GRAG: A Dynamic GraphRAG Framework for Resolving Temporal Conflicts and Redundancy in Knowledge Retrieval
di: Li, Dong, et al.
Pubblicazione: (2025)
di: Li, Dong, et al.
Pubblicazione: (2025)
Evolution of Thought: Diverse and High-Quality Reasoning via Multi-Objective Optimization
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
Discovering Hierarchy-Grounded Domains with Adaptive Granularity for Clinical Domain Generalization
di: Hu, Pengfei, et al.
Pubblicazione: (2025)
di: Hu, Pengfei, et al.
Pubblicazione: (2025)
Multiagent Finetuning: Self Improvement with Diverse Reasoning Chains
di: Subramaniam, Vighnesh, et al.
Pubblicazione: (2025)
di: Subramaniam, Vighnesh, et al.
Pubblicazione: (2025)
Exploring Accurate and Transparent Domain Adaptation in Predictive Healthcare via Concept-Grounded Orthogonal Inference
di: Hu, Pengfei, et al.
Pubblicazione: (2026)
di: Hu, Pengfei, et al.
Pubblicazione: (2026)
IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning
di: Li, Chenghao, et al.
Pubblicazione: (2026)
di: Li, Chenghao, et al.
Pubblicazione: (2026)
SMR: State Memory Replay for Long Sequence Modeling
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning
di: Chen, Jiaqi, et al.
Pubblicazione: (2025)
di: Chen, Jiaqi, et al.
Pubblicazione: (2025)
A Survey of Reinforcement Learning for Large Reasoning Models
di: Zhang, Kaiyan, et al.
Pubblicazione: (2025)
di: Zhang, Kaiyan, et al.
Pubblicazione: (2025)
InertialAR: Autoregressive 3D Molecule Generation with Inertial Frames
di: Li, Haorui, et al.
Pubblicazione: (2025)
di: Li, Haorui, et al.
Pubblicazione: (2025)
Iterative Inference in a Chess-Playing Neural Network
di: Sandmann, Elias, et al.
Pubblicazione: (2025)
di: Sandmann, Elias, et al.
Pubblicazione: (2025)
AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models
di: Jiang, Yuhua, et al.
Pubblicazione: (2025)
di: Jiang, Yuhua, et al.
Pubblicazione: (2025)
Better LLM Reasoning via Dual-Play
di: Zhang, Zhengxin, et al.
Pubblicazione: (2025)
di: Zhang, Zhengxin, et al.
Pubblicazione: (2025)
Iterative Graph Alignment
di: Yu, Fangyuan, et al.
Pubblicazione: (2024)
di: Yu, Fangyuan, et al.
Pubblicazione: (2024)
Interactive Continual Learning: Fast and Slow Thinking
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
Less is More: Efficient Model Merging with Binary Task Switch
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
WebArbiter: A Principle-Guided Reasoning Process Reward Model for Web Agents
di: Zhang, Yao, et al.
Pubblicazione: (2026)
di: Zhang, Yao, et al.
Pubblicazione: (2026)
RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling
di: Liu, Yang, et al.
Pubblicazione: (2025)
di: Liu, Yang, et al.
Pubblicazione: (2025)
TF-TransUNet1D: Time-Frequency Guided Transformer U-Net for Robust ECG Denoising in Digital Twin
di: Wang, Shijie, et al.
Pubblicazione: (2025)
di: Wang, Shijie, et al.
Pubblicazione: (2025)
SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning
di: Liu, Bo, et al.
Pubblicazione: (2025)
di: Liu, Bo, et al.
Pubblicazione: (2025)
TTSR: Test-Time Self-Reflection for Continual Reasoning Improvement
di: He, Haoyang, et al.
Pubblicazione: (2026)
di: He, Haoyang, et al.
Pubblicazione: (2026)
STRIVE: Structured Reasoning for Self-Improvement in Claim Verification
di: Gong, Haisong, et al.
Pubblicazione: (2025)
di: Gong, Haisong, et al.
Pubblicazione: (2025)
SpectrumWorld: Artificial Intelligence Foundation for Spectroscopy
di: Yang, Zhuo, et al.
Pubblicazione: (2025)
di: Yang, Zhuo, et al.
Pubblicazione: (2025)
IIP-Mixer:Intra-Inter Patch Mixing Architecture for Battery Remaining Useful Life Prediction
di: Ye, Guangzai, et al.
Pubblicazione: (2024)
di: Ye, Guangzai, et al.
Pubblicazione: (2024)
Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization
di: Li, Yu, et al.
Pubblicazione: (2026)
di: Li, Yu, et al.
Pubblicazione: (2026)
Scaling-Aware Adapter for Structure-Grounded LLM Reasoning
di: Jing, Zihao, et al.
Pubblicazione: (2026)
di: Jing, Zihao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
di: Qi, Biqing, et al.
Pubblicazione: (2024) -
Enhancing Adversarial Transferability via Information Bottleneck Constraints
di: Qi, Biqing, et al.
Pubblicazione: (2024) -
An Efficient Memory Module for Graph Few-Shot Class-Incremental Learning
di: Li, Dong, et al.
Pubblicazione: (2024) -
Graph Counselor: Adaptive Graph Exploration via Multi-Agent Synergy to Enhance LLM Reasoning
di: Gao, Junqi, et al.
Pubblicazione: (2025) -
Perturbation Towards Easy Samples Improves Targeted Adversarial Transferability
di: Gao, Junqi, et al.
Pubblicazione: (2024)