Entire Space Counterfactual Learning for Reliable Content Recommendations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Hao, Chen, Zhichao, Liu, Zhaoran, Li, Haozhe, Yang, Degui, Liu, Xinggao, Li, Haoxuan |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FreDF: Learning to Forecast in the Frequency Domain
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
Proximity Matters: Local Proximity Enhanced Balancing for Treatment Effect Estimation
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
An Accurate and Interpretable Framework for Trustworthy Process Monitoring
par: Wang, Hao, et autres
Publié: (2023)
par: Wang, Hao, et autres
Publié: (2023)
Mixture of Low Rank Adaptation with Partial Parameter Sharing for Time Series Forecasting
par: Pan, Licheng, et autres
Publié: (2025)
par: Pan, Licheng, et autres
Publié: (2025)
CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
DeepFilter: A Transformer-style Framework for Accurate and Efficient Process Monitoring
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
ECAT: A Entire space Continual and Adaptive Transfer Learning Framework for Cross-Domain Recommendation
par: Hou, Chaoqun, et autres
Publié: (2024)
par: Hou, Chaoqun, et autres
Publié: (2024)
Enabling Agents to Communicate Entirely in Latent Space
par: Du, Zhuoyun, et autres
Publié: (2025)
par: Du, Zhuoyun, et autres
Publié: (2025)
From Data-Centric to Sample-Centric: Enhancing LLM Reasoning via Progressive Optimization
par: Chen, Xinjie, et autres
Publié: (2025)
par: Chen, Xinjie, et autres
Publié: (2025)
Deep Time-series Forecasting Needs Kernelized Moment Balancing
par: Pan, Licheng, et autres
Publié: (2026)
par: Pan, Licheng, et autres
Publié: (2026)
Quadratic Direct Forecast for Training Multi-Step Time-Series Forecast Models
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
Estimating the Effects of Sample Training Orders for Large Language Models without Retraining
par: Yang, Hao, et autres
Publié: (2025)
par: Yang, Hao, et autres
Publié: (2025)
Task Priors: Enhancing Model Evaluation by Considering the Entire Space of Downstream Tasks
par: Patel, Niket, et autres
Publié: (2025)
par: Patel, Niket, et autres
Publié: (2025)
CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning
par: Zheng, Congmin, et autres
Publié: (2025)
par: Zheng, Congmin, et autres
Publié: (2025)
Time-o1: Time-Series Forecasting Needs Transformed Label Alignment
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
DistDF: Time-Series Forecasting Needs Joint-Distribution Wasserstein Alignment
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
Reason for Future, Act for Now: A Principled Framework for Autonomous LLM Agents with Provable Sample Efficiency
par: Liu, Zhihan, et autres
Publié: (2023)
par: Liu, Zhihan, et autres
Publié: (2023)
Entire Chain Uplift Modeling with Context-Enhanced Learning for Intelligent Marketing
par: Huang, Yinqiu, et autres
Publié: (2024)
par: Huang, Yinqiu, et autres
Publié: (2024)
Embed to Control Partially Observed Systems: Representation Learning with Provable Sample Efficiency
par: Wang, Lingxiao, et autres
Publié: (2022)
par: Wang, Lingxiao, et autres
Publié: (2022)
Self-Distilled Disentangled Learning for Counterfactual Prediction
par: Li, Xinshu, et autres
Publié: (2024)
par: Li, Xinshu, et autres
Publié: (2024)
IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization
par: Wang, Shuai, et autres
Publié: (2026)
par: Wang, Shuai, et autres
Publié: (2026)
FDRMFL:Multi-modal Federated Feature Extraction Model Based on Information Maximization and Contrastive Learning
par: Wu, Haozhe
Publié: (2025)
par: Wu, Haozhe
Publié: (2025)
DDTime: Dataset Distillation with Spectral Alignment and Information Bottleneck for Time-Series Forecasting
par: Li, Yuqi, et autres
Publié: (2025)
par: Li, Yuqi, et autres
Publié: (2025)
Revisiting Counterfactual Regression through the Lens of Gromov-Wasserstein Information Bottleneck
par: Yang, Hao, et autres
Publié: (2024)
par: Yang, Hao, et autres
Publié: (2024)
Reward-Augmented Data Enhances Direct Preference Alignment of LLMs
par: Zhang, Shenao, et autres
Publié: (2024)
par: Zhang, Shenao, et autres
Publié: (2024)
Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning
par: Shan, Lianlei, et autres
Publié: (2026)
par: Shan, Lianlei, et autres
Publié: (2026)
DKINet: Medication Recommendation via Domain Knowledge Informed Deep Learning
par: Liu, Sicen, et autres
Publié: (2023)
par: Liu, Sicen, et autres
Publié: (2023)
Are Transformers Able to Reason by Connecting Separated Knowledge in Training Data?
par: Yin, Yutong, et autres
Publié: (2025)
par: Yin, Yutong, et autres
Publié: (2025)
HiPER: Hierarchical Reinforcement Learning with Explicit Credit Assignment for Large Language Model Agents
par: Peng, Jiangweizhi, et autres
Publié: (2026)
par: Peng, Jiangweizhi, et autres
Publié: (2026)
Transformer-Based Spatial-Temporal Counterfactual Outcomes Estimation
par: Li, He, et autres
Publié: (2025)
par: Li, He, et autres
Publié: (2025)
Benchmarking Counterfactual Interpretability in Deep Learning Models for Time Series Classification
par: Kan, Ziwen, et autres
Publié: (2024)
par: Kan, Ziwen, et autres
Publié: (2024)
Can a Single Tree Outperform an Entire Forest?
par: Mao, Qiangqiang, et autres
Publié: (2024)
par: Mao, Qiangqiang, et autres
Publié: (2024)
LeapFactual: Reliable Visual Counterfactual Explanation Using Conditional Flow Matching
par: Cao, Zhuo, et autres
Publié: (2025)
par: Cao, Zhuo, et autres
Publié: (2025)
Budgeting Counterfactual for Offline RL
par: Liu, Yao, et autres
Publié: (2023)
par: Liu, Yao, et autres
Publié: (2023)
Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer
par: Liu, Zhihan, et autres
Publié: (2024)
par: Liu, Zhihan, et autres
Publié: (2024)
Language Models for Controllable DNA Sequence Design
par: Su, Xingyu, et autres
Publié: (2025)
par: Su, Xingyu, et autres
Publié: (2025)
Contextual Dynamic Pricing with Strategic Buyers
par: Liu, Pangpang, et autres
Publié: (2023)
par: Liu, Pangpang, et autres
Publié: (2023)
Paying Less Generalization Tax: A Cross-Domain Generalization Study of RL Training for LLM Agents
par: Liu, Zhihan, et autres
Publié: (2026)
par: Liu, Zhihan, et autres
Publié: (2026)
Pessimism in the Face of Confounders: Provably Efficient Offline Reinforcement Learning in Partially Observable Markov Decision Processes
par: Lu, Miao, et autres
Publié: (2022)
par: Lu, Miao, et autres
Publié: (2022)
Decentralized Autoregressive Generation
par: Maschan, Stepan, et autres
Publié: (2026)
par: Maschan, Stepan, et autres
Publié: (2026)
Documents similaires
-
FreDF: Learning to Forecast in the Frequency Domain
par: Wang, Hao, et autres
Publié: (2024) -
Proximity Matters: Local Proximity Enhanced Balancing for Treatment Effect Estimation
par: Wang, Hao, et autres
Publié: (2024) -
An Accurate and Interpretable Framework for Trustworthy Process Monitoring
par: Wang, Hao, et autres
Publié: (2023) -
Mixture of Low Rank Adaptation with Partial Parameter Sharing for Time Series Forecasting
par: Pan, Licheng, et autres
Publié: (2025) -
CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks
par: Wang, Hao, et autres
Publié: (2026)