TSPO: Breaking the Double Homogenization Dilemma in Multi-turn Search Policy Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Ma, Shichao, Ma, Zhiyuan, Yang, Ming, Li, Xiaofan, Wu, Xing, Du, Jintao, Cheng, Yu, Wang, Weiqiang, Liu, Qiliang, Zhou, Zhengyang, Wang, Yang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DiPO: Disentangled Perplexity Policy Optimization for Fine-grained Exploration-Exploitation Trade-Off
por: Li, Xiaofan, et al.
Publicado: (2026)
por: Li, Xiaofan, et al.
Publicado: (2026)
HAMMER: Hamiltonian Curiosity Augmented Large Language Model Reinforcement
por: Yang, Ming, et al.
Publicado: (2025)
por: Yang, Ming, et al.
Publicado: (2025)
Talk2Image: A Multi-Agent System for Multi-Turn Image Generation and Editing
por: Ma, Shichao, et al.
Publicado: (2025)
por: Ma, Shichao, et al.
Publicado: (2025)
QuiZSF: A Retrieval-Augmented Framework for Zero-Shot Time Series Forecasting
por: Ma, Shichao, et al.
Publicado: (2025)
por: Ma, Shichao, et al.
Publicado: (2025)
Mirror-Consistency: Harnessing Inconsistency in Majority Voting
por: Huang, Siyuan, et al.
Publicado: (2024)
por: Huang, Siyuan, et al.
Publicado: (2024)
Gumbel Reranking: Differentiable End-to-End Reranker Optimization
por: Huang, Siyuan, et al.
Publicado: (2025)
por: Huang, Siyuan, et al.
Publicado: (2025)
Bayesian Rational Search Engine User
por: Ma, Shichao
Publicado: (2026)
por: Ma, Shichao
Publicado: (2026)
TSPO: Temporal Sampling Policy Optimization for Long-form Video Language Understanding
por: Tang, Canhui, et al.
Publicado: (2025)
por: Tang, Canhui, et al.
Publicado: (2025)
DSPO: Stable and Efficient Policy Optimization for Agentic Search and Reasoning
por: Gu, Chenyang, et al.
Publicado: (2025)
por: Gu, Chenyang, et al.
Publicado: (2025)
Double-Strand Break Clustering: An Economical and Effective Strategy for DNA Repair
por: Chen, Junyi, et al.
Publicado: (2024)
por: Chen, Junyi, et al.
Publicado: (2024)
Joint Beamforming Optimization and Mode Selection for RDARS-Aided MIMO Systems
por: Wang, Jintao, et al.
Publicado: (2024)
por: Wang, Jintao, et al.
Publicado: (2024)
Retention Induced Biases in a Recommendation System with Heterogeneous Users
por: Ma, Shichao
Publicado: (2024)
por: Ma, Shichao
Publicado: (2024)
AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents
por: Ma, Chang, et al.
Publicado: (2024)
por: Ma, Chang, et al.
Publicado: (2024)
Workflow-R1: Group Sub-sequence Policy Optimization for Multi-turn Workflow Construction
por: Kong, Mingze, et al.
Publicado: (2026)
por: Kong, Mingze, et al.
Publicado: (2026)
TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents
por: Wang, Jiaqi, et al.
Publicado: (2026)
por: Wang, Jiaqi, et al.
Publicado: (2026)
Homogeneity Test of Proportions for Combined Unilateral and Bilateral Data via GEE and MLE Approaches
por: Zhou, Jia, et al.
Publicado: (2025)
por: Zhou, Jia, et al.
Publicado: (2025)
MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety
por: Song, Jialin, et al.
Publicado: (2026)
por: Song, Jialin, et al.
Publicado: (2026)
Trait-Aware Policy Optimization for Autoregressive Multi-Trait Essay Scoring
por: Wang, Zhengyang, et al.
Publicado: (2026)
por: Wang, Zhengyang, et al.
Publicado: (2026)
Breaking Robustness Barriers in Cognitive Diagnosis: A One-Shot Neural Architecture Search Perspective
por: Wang, Ziwen, et al.
Publicado: (2026)
por: Wang, Ziwen, et al.
Publicado: (2026)
Regressing the Relative Future: Efficient Policy Optimization for Multi-turn RLHF
por: Gao, Zhaolin, et al.
Publicado: (2024)
por: Gao, Zhaolin, et al.
Publicado: (2024)
rs6971 TSPO polymorphism in Parkinson's disease
por: Bina Patel, et al.
Publicado: (2025)
por: Bina Patel, et al.
Publicado: (2025)
Characterizing the Dilemma of Performance and Index Size in Billion-Scale Vector Search and Breaking It with Second-Tier Memory
por: Cheng, Rongxin, et al.
Publicado: (2024)
por: Cheng, Rongxin, et al.
Publicado: (2024)
Training with Harnesses: On-Policy Harness Self-Distillation for Complex Reasoning
por: Zhao, Zhengyang, et al.
Publicado: (2026)
por: Zhao, Zhengyang, et al.
Publicado: (2026)
A General ReLearner: Empowering Spatiotemporal Prediction by Re-learning Input-label Residual
por: Ma, Jiaming, et al.
Publicado: (2026)
por: Ma, Jiaming, et al.
Publicado: (2026)
HoneyGPT: Breaking the Trilemma in Terminal Honeypots with Large Language Model
por: Wang, Ziyang, et al.
Publicado: (2024)
por: Wang, Ziyang, et al.
Publicado: (2024)
Double Duality: Variational Primal-Dual Policy Optimization for Constrained Reinforcement Learning
por: Li, Zihao, et al.
Publicado: (2024)
por: Li, Zihao, et al.
Publicado: (2024)
Robust Beamforming Design and Antenna Selection for Dynamic HRIS-aided MISO System
por: Wang, Jintao, et al.
Publicado: (2024)
por: Wang, Jintao, et al.
Publicado: (2024)
Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models
por: Yao, Jingfeng, et al.
Publicado: (2025)
por: Yao, Jingfeng, et al.
Publicado: (2025)
A Nonlinear Multi‐Objective Prediction Strategy for Small‐Sample Datasets in Homogeneous Catalysis
por: Yining Liu, et al.
Publicado: (2026)
por: Yining Liu, et al.
Publicado: (2026)
A novel chromone Schiff base as Zn2+ turn‐on fluorescent chemosensor in a mixed solution
por: Wensheng Yang, et al.
Publicado: (2024)
por: Wensheng Yang, et al.
Publicado: (2024)
SAPIENT: Mastering Multi-turn Conversational Recommendation with Strategic Planning and Monte Carlo Tree Search
por: Du, Hanwen, et al.
Publicado: (2024)
por: Du, Hanwen, et al.
Publicado: (2024)
LaPuda: LLM-Enabled Policy-Based Query Optimizer for Multi-modal Data
por: Wang, Yifan, et al.
Publicado: (2024)
por: Wang, Yifan, et al.
Publicado: (2024)
Breaking the Under‐Display Camera's Dilemma Between Diffraction and Pixel Density Using Incoherent Pupil Synthesis
por: Xinni Xie, et al.
Publicado: (2026)
por: Xinni Xie, et al.
Publicado: (2026)
On the elastic–plastic behaviors of centrifugal steam compressor impeller under cyclic thermomechanical loading
por: Jianxun Li, et al.
Publicado: (2024)
por: Jianxun Li, et al.
Publicado: (2024)
Double-Edged Sword or Sharp Tool? Designing and Evaluating Triadic LLM-Teacher Collaboration for K-12 Writing at Scale
por: Wang, Canran, et al.
Publicado: (2026)
por: Wang, Canran, et al.
Publicado: (2026)
Near-Optimal Policy Optimization for Correlated Equilibrium in General-Sum Markov Games
por: Cai, Yang, et al.
Publicado: (2024)
por: Cai, Yang, et al.
Publicado: (2024)
CaliCausalRank: Calibrated Multi-Objective Ad Ranking with Robust Counterfactual Utility Optimization
por: Yang, Xikai, et al.
Publicado: (2026)
por: Yang, Xikai, et al.
Publicado: (2026)
Entrepreneurship and Natural Resource Curse on Regional Economic Resilience: Evidence From China
por: Mao Qiliang, et al.
Publicado: (2025)
por: Mao Qiliang, et al.
Publicado: (2025)
Flow-based Policy With Distributional Reinforcement Learning in Trajectory Optimization
por: Hao, Ruijie, et al.
Publicado: (2026)
por: Hao, Ruijie, et al.
Publicado: (2026)
A Low-Overhead Incorporation-Extrapolation based Few-Shot CSI Feedback Framework for Massive MIMO Systems
por: Zhou, Binggui, et al.
Publicado: (2023)
por: Zhou, Binggui, et al.
Publicado: (2023)
Ejemplares similares
-
DiPO: Disentangled Perplexity Policy Optimization for Fine-grained Exploration-Exploitation Trade-Off
por: Li, Xiaofan, et al.
Publicado: (2026) -
HAMMER: Hamiltonian Curiosity Augmented Large Language Model Reinforcement
por: Yang, Ming, et al.
Publicado: (2025) -
Talk2Image: A Multi-Agent System for Multi-Turn Image Generation and Editing
por: Ma, Shichao, et al.
Publicado: (2025) -
QuiZSF: A Retrieval-Augmented Framework for Zero-Shot Time Series Forecasting
por: Ma, Shichao, et al.
Publicado: (2025) -
Mirror-Consistency: Harnessing Inconsistency in Majority Voting
por: Huang, Siyuan, et al.
Publicado: (2024)