Entire Space Counterfactual Learning for Reliable Content Recommendations
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Hao, Chen, Zhichao, Liu, Zhaoran, Li, Haozhe, Yang, Degui, Liu, Xinggao, Li, Haoxuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2022
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FreDF: Learning to Forecast in the Frequency Domain
por: Wang, Hao, et al.
Publicado: (2024)
por: Wang, Hao, et al.
Publicado: (2024)
Proximity Matters: Local Proximity Enhanced Balancing for Treatment Effect Estimation
por: Wang, Hao, et al.
Publicado: (2024)
por: Wang, Hao, et al.
Publicado: (2024)
An Accurate and Interpretable Framework for Trustworthy Process Monitoring
por: Wang, Hao, et al.
Publicado: (2023)
por: Wang, Hao, et al.
Publicado: (2023)
Mixture of Low Rank Adaptation with Partial Parameter Sharing for Time Series Forecasting
por: Pan, Licheng, et al.
Publicado: (2025)
por: Pan, Licheng, et al.
Publicado: (2025)
CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
DeepFilter: A Transformer-style Framework for Accurate and Efficient Process Monitoring
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
ECAT: A Entire space Continual and Adaptive Transfer Learning Framework for Cross-Domain Recommendation
por: Hou, Chaoqun, et al.
Publicado: (2024)
por: Hou, Chaoqun, et al.
Publicado: (2024)
Enabling Agents to Communicate Entirely in Latent Space
por: Du, Zhuoyun, et al.
Publicado: (2025)
por: Du, Zhuoyun, et al.
Publicado: (2025)
From Data-Centric to Sample-Centric: Enhancing LLM Reasoning via Progressive Optimization
por: Chen, Xinjie, et al.
Publicado: (2025)
por: Chen, Xinjie, et al.
Publicado: (2025)
Deep Time-series Forecasting Needs Kernelized Moment Balancing
por: Pan, Licheng, et al.
Publicado: (2026)
por: Pan, Licheng, et al.
Publicado: (2026)
Quadratic Direct Forecast for Training Multi-Step Time-Series Forecast Models
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
Estimating the Effects of Sample Training Orders for Large Language Models without Retraining
por: Yang, Hao, et al.
Publicado: (2025)
por: Yang, Hao, et al.
Publicado: (2025)
Task Priors: Enhancing Model Evaluation by Considering the Entire Space of Downstream Tasks
por: Patel, Niket, et al.
Publicado: (2025)
por: Patel, Niket, et al.
Publicado: (2025)
CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning
por: Zheng, Congmin, et al.
Publicado: (2025)
por: Zheng, Congmin, et al.
Publicado: (2025)
Time-o1: Time-Series Forecasting Needs Transformed Label Alignment
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
DistDF: Time-Series Forecasting Needs Joint-Distribution Wasserstein Alignment
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
Reason for Future, Act for Now: A Principled Framework for Autonomous LLM Agents with Provable Sample Efficiency
por: Liu, Zhihan, et al.
Publicado: (2023)
por: Liu, Zhihan, et al.
Publicado: (2023)
Entire Chain Uplift Modeling with Context-Enhanced Learning for Intelligent Marketing
por: Huang, Yinqiu, et al.
Publicado: (2024)
por: Huang, Yinqiu, et al.
Publicado: (2024)
Embed to Control Partially Observed Systems: Representation Learning with Provable Sample Efficiency
por: Wang, Lingxiao, et al.
Publicado: (2022)
por: Wang, Lingxiao, et al.
Publicado: (2022)
Self-Distilled Disentangled Learning for Counterfactual Prediction
por: Li, Xinshu, et al.
Publicado: (2024)
por: Li, Xinshu, et al.
Publicado: (2024)
IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization
por: Wang, Shuai, et al.
Publicado: (2026)
por: Wang, Shuai, et al.
Publicado: (2026)
FDRMFL:Multi-modal Federated Feature Extraction Model Based on Information Maximization and Contrastive Learning
por: Wu, Haozhe
Publicado: (2025)
por: Wu, Haozhe
Publicado: (2025)
DDTime: Dataset Distillation with Spectral Alignment and Information Bottleneck for Time-Series Forecasting
por: Li, Yuqi, et al.
Publicado: (2025)
por: Li, Yuqi, et al.
Publicado: (2025)
Revisiting Counterfactual Regression through the Lens of Gromov-Wasserstein Information Bottleneck
por: Yang, Hao, et al.
Publicado: (2024)
por: Yang, Hao, et al.
Publicado: (2024)
Reward-Augmented Data Enhances Direct Preference Alignment of LLMs
por: Zhang, Shenao, et al.
Publicado: (2024)
por: Zhang, Shenao, et al.
Publicado: (2024)
Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning
por: Shan, Lianlei, et al.
Publicado: (2026)
por: Shan, Lianlei, et al.
Publicado: (2026)
DKINet: Medication Recommendation via Domain Knowledge Informed Deep Learning
por: Liu, Sicen, et al.
Publicado: (2023)
por: Liu, Sicen, et al.
Publicado: (2023)
Are Transformers Able to Reason by Connecting Separated Knowledge in Training Data?
por: Yin, Yutong, et al.
Publicado: (2025)
por: Yin, Yutong, et al.
Publicado: (2025)
HiPER: Hierarchical Reinforcement Learning with Explicit Credit Assignment for Large Language Model Agents
por: Peng, Jiangweizhi, et al.
Publicado: (2026)
por: Peng, Jiangweizhi, et al.
Publicado: (2026)
Transformer-Based Spatial-Temporal Counterfactual Outcomes Estimation
por: Li, He, et al.
Publicado: (2025)
por: Li, He, et al.
Publicado: (2025)
Benchmarking Counterfactual Interpretability in Deep Learning Models for Time Series Classification
por: Kan, Ziwen, et al.
Publicado: (2024)
por: Kan, Ziwen, et al.
Publicado: (2024)
Can a Single Tree Outperform an Entire Forest?
por: Mao, Qiangqiang, et al.
Publicado: (2024)
por: Mao, Qiangqiang, et al.
Publicado: (2024)
LeapFactual: Reliable Visual Counterfactual Explanation Using Conditional Flow Matching
por: Cao, Zhuo, et al.
Publicado: (2025)
por: Cao, Zhuo, et al.
Publicado: (2025)
Budgeting Counterfactual for Offline RL
por: Liu, Yao, et al.
Publicado: (2023)
por: Liu, Yao, et al.
Publicado: (2023)
Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer
por: Liu, Zhihan, et al.
Publicado: (2024)
por: Liu, Zhihan, et al.
Publicado: (2024)
Language Models for Controllable DNA Sequence Design
por: Su, Xingyu, et al.
Publicado: (2025)
por: Su, Xingyu, et al.
Publicado: (2025)
Contextual Dynamic Pricing with Strategic Buyers
por: Liu, Pangpang, et al.
Publicado: (2023)
por: Liu, Pangpang, et al.
Publicado: (2023)
Paying Less Generalization Tax: A Cross-Domain Generalization Study of RL Training for LLM Agents
por: Liu, Zhihan, et al.
Publicado: (2026)
por: Liu, Zhihan, et al.
Publicado: (2026)
Pessimism in the Face of Confounders: Provably Efficient Offline Reinforcement Learning in Partially Observable Markov Decision Processes
por: Lu, Miao, et al.
Publicado: (2022)
por: Lu, Miao, et al.
Publicado: (2022)
Decentralized Autoregressive Generation
por: Maschan, Stepan, et al.
Publicado: (2026)
por: Maschan, Stepan, et al.
Publicado: (2026)
Ejemplares similares
-
FreDF: Learning to Forecast in the Frequency Domain
por: Wang, Hao, et al.
Publicado: (2024) -
Proximity Matters: Local Proximity Enhanced Balancing for Treatment Effect Estimation
por: Wang, Hao, et al.
Publicado: (2024) -
An Accurate and Interpretable Framework for Trustworthy Process Monitoring
por: Wang, Hao, et al.
Publicado: (2023) -
Mixture of Low Rank Adaptation with Partial Parameter Sharing for Time Series Forecasting
por: Pan, Licheng, et al.
Publicado: (2025) -
CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks
por: Wang, Hao, et al.
Publicado: (2026)