Guidance Contrastive Token Credit Assignment for Discrete Policy Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Shufan, Kallidromitis, Konstantinos, Gokul, Akash, Kyuragi, Yuta, Grover, Aditya |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Aligning Diffusion Models by Optimizing Human Utility
por: Li, Shufan, et al.
Publicado: (2024)
por: Li, Shufan, et al.
Publicado: (2024)
Reflect-DiT: Inference-Time Scaling for Text-to-Image Diffusion Transformers via In-Context Reflection
por: Li, Shufan, et al.
Publicado: (2025)
por: Li, Shufan, et al.
Publicado: (2025)
OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows
por: Li, Shufan, et al.
Publicado: (2024)
por: Li, Shufan, et al.
Publicado: (2024)
LaViDa: A Large Diffusion Language Model for Multimodal Understanding
por: Li, Shufan, et al.
Publicado: (2025)
por: Li, Shufan, et al.
Publicado: (2025)
PopAlign: Population-Level Alignment for Fair Text-to-Image Generation
por: Li, Shufan, et al.
Publicado: (2024)
por: Li, Shufan, et al.
Publicado: (2024)
Mamba-ND: Selective State Space Modeling for Multi-Dimensional Data
por: Li, Shufan, et al.
Publicado: (2024)
por: Li, Shufan, et al.
Publicado: (2024)
InstructAny2Pix: Flexible Visual Editing via Multimodal Instruction Following
por: Li, Shufan, et al.
Publicado: (2023)
por: Li, Shufan, et al.
Publicado: (2023)
SNCE: Geometry-Aware Supervision for Scalable Discrete Image Generation
por: Li, Shufan, et al.
Publicado: (2026)
por: Li, Shufan, et al.
Publicado: (2026)
Accelerating Inference of Masked Image Generators via Reinforcement Learning
por: Subbaraman, Pranav, et al.
Publicado: (2025)
por: Subbaraman, Pranav, et al.
Publicado: (2025)
Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models
por: Li, Shufan, et al.
Publicado: (2025)
por: Li, Shufan, et al.
Publicado: (2025)
SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More
por: Huang, Muye, et al.
Publicado: (2026)
por: Huang, Muye, et al.
Publicado: (2026)
SegLLM: Multi-round Reasoning Segmentation
por: Wang, XuDong, et al.
Publicado: (2024)
por: Wang, XuDong, et al.
Publicado: (2024)
Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation
por: Li, Shufan, et al.
Publicado: (2025)
por: Li, Shufan, et al.
Publicado: (2025)
UniEgoMotion: A Unified Model for Egocentric Motion Reconstruction, Forecasting, and Generation
por: Patel, Chaitanya, et al.
Publicado: (2025)
por: Patel, Chaitanya, et al.
Publicado: (2025)
MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants
por: Bansal, Hritik, et al.
Publicado: (2024)
por: Bansal, Hritik, et al.
Publicado: (2024)
MobileWorldBench: Towards Semantic World Modeling For Mobile Agents
por: Li, Shufan, et al.
Publicado: (2025)
por: Li, Shufan, et al.
Publicado: (2025)
Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
por: Qin, Yiming, et al.
Publicado: (2025)
por: Qin, Yiming, et al.
Publicado: (2025)
LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models
por: Li, Shufan, et al.
Publicado: (2026)
por: Li, Shufan, et al.
Publicado: (2026)
Deep Multiview Clustering by Contrasting Cluster Assignments
por: Chen, Jie, et al.
Publicado: (2023)
por: Chen, Jie, et al.
Publicado: (2023)
Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment
por: Chen, Jingkun, et al.
Publicado: (2026)
por: Chen, Jingkun, et al.
Publicado: (2026)
Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought
por: Li, Yunheng, et al.
Publicado: (2026)
por: Li, Yunheng, et al.
Publicado: (2026)
TokenPure: Watermark Removal through Tokenized Appearance and Structural Guidance
por: Yang, Pei, et al.
Publicado: (2025)
por: Yang, Pei, et al.
Publicado: (2025)
CAVE: A Structured Credit Assignment Approach for Fragmented Visual Evidence Reasoning
por: Guo, Tengda, et al.
Publicado: (2026)
por: Guo, Tengda, et al.
Publicado: (2026)
Few-Shot Classification of Interactive Activities of Daily Living (InteractADL)
por: Durante, Zane, et al.
Publicado: (2024)
por: Durante, Zane, et al.
Publicado: (2024)
Hyperbolic Active Learning for Semantic Segmentation under Domain Shift
por: Franco, Luca, et al.
Publicado: (2023)
por: Franco, Luca, et al.
Publicado: (2023)
CPPO: Contrastive Perception Policy Optimization for VLM Agents
por: Rezaei, Ahmad, et al.
Publicado: (2026)
por: Rezaei, Ahmad, et al.
Publicado: (2026)
Discrete JEPA: Learning Discrete Token Representations without Reconstruction
por: Baek, Junyeob, et al.
Publicado: (2025)
por: Baek, Junyeob, et al.
Publicado: (2025)
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
por: Zhang, Luyuan, et al.
Publicado: (2026)
por: Zhang, Luyuan, et al.
Publicado: (2026)
xT: Nested Tokenization for Larger Context in Large Images
por: Gupta, Ritwik, et al.
Publicado: (2024)
por: Gupta, Ritwik, et al.
Publicado: (2024)
Scaling Vision-and-Language Navigation With Offline RL
por: Bundele, Valay, et al.
Publicado: (2024)
por: Bundele, Valay, et al.
Publicado: (2024)
CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates
por: Grover, Shresth, et al.
Publicado: (2025)
por: Grover, Shresth, et al.
Publicado: (2025)
Stepwise Credit Assignment for GRPO on Flow-Matching Models
por: Savani, Yash, et al.
Publicado: (2026)
por: Savani, Yash, et al.
Publicado: (2026)
Generative Multimodal Pretraining with Discrete Diffusion Timestep Tokens
por: Pan, Kaihang, et al.
Publicado: (2025)
por: Pan, Kaihang, et al.
Publicado: (2025)
AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization
por: He, Dailan, et al.
Publicado: (2026)
por: He, Dailan, et al.
Publicado: (2026)
Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens
por: Wang, Yuqing, et al.
Publicado: (2026)
por: Wang, Yuqing, et al.
Publicado: (2026)
Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning
por: Wang, Bohan, et al.
Publicado: (2025)
por: Wang, Bohan, et al.
Publicado: (2025)
WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction
por: Zhuang, Shaobin, et al.
Publicado: (2025)
por: Zhuang, Shaobin, et al.
Publicado: (2025)
BootPIG: Bootstrapping Zero-shot Personalized Image Generation Capabilities in Pretrained Diffusion Models
por: Purushwalkam, Senthil, et al.
Publicado: (2024)
por: Purushwalkam, Senthil, et al.
Publicado: (2024)
Bridging Continuous and Discrete Tokens for Autoregressive Visual Generation
por: Wang, Yuqing, et al.
Publicado: (2025)
por: Wang, Yuqing, et al.
Publicado: (2025)
TRIO: Token Reduction via Inference-Objective Guidance for Efficient Vision-Language Models
por: Zhang, Haokui, et al.
Publicado: (2026)
por: Zhang, Haokui, et al.
Publicado: (2026)
Ejemplares similares
-
Aligning Diffusion Models by Optimizing Human Utility
por: Li, Shufan, et al.
Publicado: (2024) -
Reflect-DiT: Inference-Time Scaling for Text-to-Image Diffusion Transformers via In-Context Reflection
por: Li, Shufan, et al.
Publicado: (2025) -
OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows
por: Li, Shufan, et al.
Publicado: (2024) -
LaViDa: A Large Diffusion Language Model for Multimodal Understanding
por: Li, Shufan, et al.
Publicado: (2025) -
PopAlign: Population-Level Alignment for Fair Text-to-Image Generation
por: Li, Shufan, et al.
Publicado: (2024)