DiPO: Disentangled Perplexity Policy Optimization for Fine-grained Exploration-Exploitation Trade-Off
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Xiaofan, Yang, Ming, Ma, Zhiyuan, Ma, Shichao, Du, Jintao, Cheng, Yu, Wang, Weiqiang, Zhang, Zhizhong, Tan, Xin, Qu, Yanyun, Ma, Lizhuang, Xie, Yuan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PromptAD: Learning Prompts with only Normal Samples for Few-Shot Anomaly Detection
par: Li, Xiaofan, et autres
Publié: (2024)
par: Li, Xiaofan, et autres
Publié: (2024)
COTR: Compact Occupancy TRansformer for Vision-based 3D Occupancy Prediction
par: Ma, Qihang, et autres
Publié: (2023)
par: Ma, Qihang, et autres
Publié: (2023)
TSPO: Breaking the Double Homogenization Dilemma in Multi-turn Search Policy Optimization
par: Ma, Shichao, et autres
Publié: (2026)
par: Ma, Shichao, et autres
Publié: (2026)
One-for-More: Continual Diffusion Model for Anomaly Detection
par: Li, Xiaofan, et autres
Publié: (2025)
par: Li, Xiaofan, et autres
Publié: (2025)
BEAR: A Video Dataset For Fine-grained Behaviors Recognition Oriented with Action and Environment Factors
par: Hu, Chengyang, et autres
Publié: (2025)
par: Hu, Chengyang, et autres
Publié: (2025)
Disentangling Exploration from Exploitation
par: Lizzeri, Alessandro, et autres
Publié: (2024)
par: Lizzeri, Alessandro, et autres
Publié: (2024)
HAMMER: Hamiltonian Curiosity Augmented Large Language Model Reinforcement
par: Yang, Ming, et autres
Publié: (2025)
par: Yang, Ming, et autres
Publié: (2025)
Mirror-Consistency: Harnessing Inconsistency in Majority Voting
par: Huang, Siyuan, et autres
Publié: (2024)
par: Huang, Siyuan, et autres
Publié: (2024)
Distribution-Centric Policy Optimization Dominates Exploration-Exploitation Trade-off
par: Li, Zhaochun, et autres
Publié: (2026)
par: Li, Zhaochun, et autres
Publié: (2026)
GSCompleter: A Distillation-Free Plugin for Metric-Aware 3D Gaussian Splatting Completion in Seconds
par: Gao, Ao, et autres
Publié: (2026)
par: Gao, Ao, et autres
Publié: (2026)
S2GS: Streaming Semantic Gaussian Splatting for Online Scene Understanding and Reconstruction
par: Zhang, Renhe, et autres
Publié: (2026)
par: Zhang, Renhe, et autres
Publié: (2026)
Beyond the Label Itself: Latent Labels Enhance Semi-supervised Point Cloud Panoptic Segmentation
par: Chen, Yujun, et autres
Publié: (2023)
par: Chen, Yujun, et autres
Publié: (2023)
Exploring the Untouched Sweeps for Conflict-Aware 3D Segmentation Pretraining
par: Sun, Tianfang, et autres
Publié: (2024)
par: Sun, Tianfang, et autres
Publié: (2024)
Disentangling Exploration of Large Language Models by Optimal Exploitation
par: Grams, Tim, et autres
Publié: (2025)
par: Grams, Tim, et autres
Publié: (2025)
Retention Induced Biases in a Recommendation System with Heterogeneous Users
par: Ma, Shichao
Publié: (2024)
par: Ma, Shichao
Publié: (2024)
Bayesian Rational Search Engine User
par: Ma, Shichao
Publié: (2026)
par: Ma, Shichao
Publié: (2026)
FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation
par: Fang, Xueji, et autres
Publié: (2026)
par: Fang, Xueji, et autres
Publié: (2026)
Trade‐Offs Between Economic Gains and Ecological Goals: Impact of Marine Ecological Policy on Marine Fisheries Efficiency
par: Jintao Ma, et autres
Publié: (2025)
par: Jintao Ma, et autres
Publié: (2025)
Auto-configuring Exploration-Exploitation Tradeoff in Evolutionary Computation via Deep Reinforcement Learning
par: Ma, Zeyuan, et autres
Publié: (2024)
par: Ma, Zeyuan, et autres
Publié: (2024)
Vision-language models lag human performance on physical dynamics and intent reasoning
par: Gu, Tianjun, et autres
Publié: (2026)
par: Gu, Tianjun, et autres
Publié: (2026)
Normalized solution for $p$-Laplacian equation in exterior domain
par: Zhang, Weiqiang, et autres
Publié: (2024)
par: Zhang, Weiqiang, et autres
Publié: (2024)
Gaussian‐Sigmoid Reinforcement Transistors: Resolving Exploration‐Exploitation Trade‐Off Through Gate Voltage‐Controlled Activation Functions
par: Jisoo Park, et autres
Publié: (2025)
par: Jisoo Park, et autres
Publié: (2025)
Di3PO - Diptych Diffusion DPO for Targeted Improvements in Image Generation
par: Reddy, Sanjana, et autres
Publié: (2026)
par: Reddy, Sanjana, et autres
Publié: (2026)
Gumbel Reranking: Differentiable End-to-End Reranker Optimization
par: Huang, Siyuan, et autres
Publié: (2025)
par: Huang, Siyuan, et autres
Publié: (2025)
Failure Cases Are Better Learned But Boundary Says Sorry: Facilitating Smooth Perception Change for Accuracy-Robustness Trade-Off in Adversarial Training
par: Wang, Yanyun, et autres
Publié: (2025)
par: Wang, Yanyun, et autres
Publié: (2025)
Continual-NExT: A Unified Comprehension And Generation Continual Learning Framework
par: Qiao, Jingyang, et autres
Publié: (2026)
par: Qiao, Jingyang, et autres
Publié: (2026)
Large Continual Instruction Assistant
par: Qiao, Jingyang, et autres
Publié: (2024)
par: Qiao, Jingyang, et autres
Publié: (2024)
T2S: Tokenized Skill Scaling for Lifelong Imitation Learning
par: Zhang, Hongquan, et autres
Publié: (2025)
par: Zhang, Hongquan, et autres
Publié: (2025)
Building a Strong Pre-Training Baseline for Universal 3D Large-Scale Perception
par: Chen, Haoming, et autres
Publié: (2024)
par: Chen, Haoming, et autres
Publié: (2024)
Learn Faster and Remember More: Balancing Exploration and Exploitation for Continual Test-time Adaptation
par: Yang, Pinci, et autres
Publié: (2025)
par: Yang, Pinci, et autres
Publié: (2025)
When Are Trade-Off Functions Testable from Finite Samples?
par: Shi, Kaining, et autres
Publié: (2026)
par: Shi, Kaining, et autres
Publié: (2026)
Trade Liberalisation and the Gender Wage Gap: Evidence From Pilot Free Trade Zones Policy Reform in China
par: Xinxin Ma
Publié: (2025)
par: Xinxin Ma
Publié: (2025)
DrivingForward: Feed-forward 3D Gaussian Splatting for Driving Scene Reconstruction from Flexible Surround-view Input
par: Tian, Qijian, et autres
Publié: (2024)
par: Tian, Qijian, et autres
Publié: (2024)
PFDepth: Heterogeneous Pinhole-Fisheye Joint Depth Estimation via Distortion-aware Gaussian-Splatted Volumetric Fusion
par: Zhang, Zhiwei, et autres
Publié: (2025)
par: Zhang, Zhiwei, et autres
Publié: (2025)
GEOcc: Geometrically Enhanced 3D Occupancy Network with Implicit-Explicit Depth Fusion and Contextual Self-Supervision
par: Tan, Xin, et autres
Publié: (2024)
par: Tan, Xin, et autres
Publié: (2024)
From Enhancement to Understanding: Build a Generalized Bridge for Low-light Vision via Semantically Consistent Unsupervised Fine-tuning
par: Wang, Sen, et autres
Publié: (2025)
par: Wang, Sen, et autres
Publié: (2025)
Achievable Trade-Off in Network Nonlocality Sharing
par: Li, Ming-Xiao, et autres
Publié: (2025)
par: Li, Ming-Xiao, et autres
Publié: (2025)
Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration
par: Wang, Sen, et autres
Publié: (2026)
par: Wang, Sen, et autres
Publié: (2026)
LidarPainter: One-Step Away From Any Lidar View To Novel Guidance
par: Ji, Yuzhou, et autres
Publié: (2025)
par: Ji, Yuzhou, et autres
Publié: (2025)
DEMOS: Dynamic Environment Motion Synthesis in 3D Scenes via Local Spherical-BEV Perception
par: Gong, Jingyu, et autres
Publié: (2024)
par: Gong, Jingyu, et autres
Publié: (2024)
Documents similaires
-
PromptAD: Learning Prompts with only Normal Samples for Few-Shot Anomaly Detection
par: Li, Xiaofan, et autres
Publié: (2024) -
COTR: Compact Occupancy TRansformer for Vision-based 3D Occupancy Prediction
par: Ma, Qihang, et autres
Publié: (2023) -
TSPO: Breaking the Double Homogenization Dilemma in Multi-turn Search Policy Optimization
par: Ma, Shichao, et autres
Publié: (2026) -
One-for-More: Continual Diffusion Model for Anomaly Detection
par: Li, Xiaofan, et autres
Publié: (2025) -
BEAR: A Video Dataset For Fine-grained Behaviors Recognition Oriented with Action and Environment Factors
par: Hu, Chengyang, et autres
Publié: (2025)