PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Susladkar, Onkar, Prakash, Tushar, Juvekar, Adheesh, Nguyen, Kiet A., Jang, Dong-Hwan, Dhillon, Inderjit S, Lourentzou, Ismini |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Best of Both Worlds: Multimodal Reasoning and Generation via Unified Discrete Flow Matching
par: Susladkar, Onkar, et autres
Publié: (2026)
par: Susladkar, Onkar, et autres
Publié: (2026)
RewardFlow: Generate Images by Optimizing What You Reward
par: Susladkar, Onkar, et autres
Publié: (2026)
par: Susladkar, Onkar, et autres
Publié: (2026)
CALICO: Part-Focused Semantic Co-Segmentation with Large Vision-Language Models
par: Nguyen, Kiet A., et autres
Publié: (2024)
par: Nguyen, Kiet A., et autres
Publié: (2024)
Uncertainty in Action: Confidence Elicitation in Embodied Agents
par: Yu, Tianjiao, et autres
Publié: (2025)
par: Yu, Tianjiao, et autres
Publié: (2025)
PRIMA: Multi-Image Vision-Language Models for Reasoning Segmentation
par: Wahed, Muntasir, et autres
Publié: (2024)
par: Wahed, Muntasir, et autres
Publié: (2024)
Counterfactual Segmentation Reasoning: Diagnosing and Mitigating Pixel-Grounding Hallucination
par: Li, Xinzhuo, et autres
Publié: (2025)
par: Li, Xinzhuo, et autres
Publié: (2025)
Commonsense for Zero-Shot Natural Language Video Localization
par: Holla, Meghana, et autres
Publié: (2023)
par: Holla, Meghana, et autres
Publié: (2023)
Part$^{2}$GS: Part-aware Modeling of Articulated Objects using 3D Gaussian Splatting
par: Yu, Tianjiao, et autres
Publié: (2025)
par: Yu, Tianjiao, et autres
Publié: (2025)
Phantom: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics
par: Shen, Ying, et autres
Publié: (2026)
par: Shen, Ying, et autres
Publié: (2026)
3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding
par: Ogunleye, Makanjuola, et autres
Publié: (2026)
par: Ogunleye, Makanjuola, et autres
Publié: (2026)
mTSBench: Benchmarking Multivariate Time Series Anomaly Detection and Model Selection at Scale
par: Zhou, Xiaona, et autres
Publié: (2025)
par: Zhou, Xiaona, et autres
Publié: (2025)
MOCHA: Are Code Language Models Robust Against Multi-Turn Malicious Coding Prompts?
par: Wahed, Muntasir, et autres
Publié: (2025)
par: Wahed, Muntasir, et autres
Publié: (2025)
MotionAura: Generating High-Quality and Motion Consistent Videos using Discrete Diffusion
par: Susladkar, Onkar, et autres
Publié: (2024)
par: Susladkar, Onkar, et autres
Publié: (2024)
RAVEL: Rare Concept Generation and Editing via Graph-driven Relational Guidance
par: Venkatesh, Kavana, et autres
Publié: (2024)
par: Venkatesh, Kavana, et autres
Publié: (2024)
Bahasa Harmony: A Comprehensive Dataset for Bahasa Text-to-Speech Synthesis with Discrete Codec Modeling of EnGen-TTS
par: Susladkar, Onkar Kishor, et autres
Publié: (2024)
par: Susladkar, Onkar Kishor, et autres
Publié: (2024)
Historic Scripts to Modern Vision: A Novel Dataset and A VLM Framework for Transliteration of Modi Script to Devanagari
par: Kausadikar, Harshal, et autres
Publié: (2025)
par: Kausadikar, Harshal, et autres
Publié: (2025)
D2Styler: Advancing Arbitrary Style Transfer with Discrete Diffusion Methods
par: Susladkar, Onkar, et autres
Publié: (2024)
par: Susladkar, Onkar, et autres
Publié: (2024)
PyraVid: Hierarchical Multimodal Memory for Long-Horizon Video Reasoning
par: Yan, Sikuan, et autres
Publié: (2026)
par: Yan, Sikuan, et autres
Publié: (2026)
Tiny but Trusted: Efficient Vision-Language Reasoning for Time-Series Anomaly Detection
par: Zhou, Xiaona, et autres
Publié: (2026)
par: Zhou, Xiaona, et autres
Publié: (2026)
LASER: Attention with Exponential Transformation
par: Duvvuri, Sai Surya, et autres
Publié: (2024)
par: Duvvuri, Sai Surya, et autres
Publié: (2024)
Hierarchical Dataset Selection for High-Quality Data Sharing
par: Zhou, Xiaona, et autres
Publié: (2025)
par: Zhou, Xiaona, et autres
Publié: (2025)
FAIR: Facilitating Artificial Intelligence Resilience in Manufacturing Industrial Internet
par: Zeng, Yingyan, et autres
Publié: (2025)
par: Zeng, Yingyan, et autres
Publié: (2025)
ELBA: Learning by Asking for Embodied Visual Navigation and Task Completion
par: Shen, Ying, et autres
Publié: (2023)
par: Shen, Ying, et autres
Publié: (2023)
ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization
par: Patel, Nirmal, et autres
Publié: (2026)
par: Patel, Nirmal, et autres
Publié: (2026)
Geometric Median (GM) Matching for Robust Data Pruning
par: Acharya, Anish, et autres
Publié: (2024)
par: Acharya, Anish, et autres
Publié: (2024)
AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
par: Chen, Bowei, et autres
Publié: (2025)
par: Chen, Bowei, et autres
Publié: (2025)
RefTok: Reference-Based Tokenization for Video Generation
par: Fan, Xiang, et autres
Publié: (2025)
par: Fan, Xiang, et autres
Publié: (2025)
TrajTok: Learning Trajectory Tokens enables better Video Understanding
par: Zheng, Chenhao, et autres
Publié: (2026)
par: Zheng, Chenhao, et autres
Publié: (2026)
ViCTr: Vital Consistency Transfer for Pathology Aware Image Synthesis
par: Susladkar, Onkar, et autres
Publié: (2025)
par: Susladkar, Onkar, et autres
Publié: (2025)
UniTok: A Unified Tokenizer for Visual Generation and Understanding
par: Ma, Chuofan, et autres
Publié: (2025)
par: Ma, Chuofan, et autres
Publié: (2025)
MuseTok: Symbolic Music Tokenization for Generation and Semantic Understanding
par: Huang, Jingyue, et autres
Publié: (2025)
par: Huang, Jingyue, et autres
Publié: (2025)
MMPlanner: Zero-Shot Multimodal Procedural Planning with Chain-of-Thought Object State Reasoning
par: Tabassum, Afrina, et autres
Publié: (2025)
par: Tabassum, Afrina, et autres
Publié: (2025)
uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures
par: Tabassum, Afrina, et autres
Publié: (2024)
par: Tabassum, Afrina, et autres
Publié: (2024)
CoRe3D: Collaborative Reasoning as a Foundation for 3D Intelligence
par: Yu, Tianjiao, et autres
Publié: (2025)
par: Yu, Tianjiao, et autres
Publié: (2025)
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
par: Zhang, Hongzhi, et autres
Publié: (2025)
par: Zhang, Hongzhi, et autres
Publié: (2025)
TokAlign: Efficient Vocabulary Adaptation via Token Alignment
par: Li, Chong, et autres
Publié: (2025)
par: Li, Chong, et autres
Publié: (2025)
ElasticTok: Adaptive Tokenization for Image and Video
par: Yan, Wilson, et autres
Publié: (2024)
par: Yan, Wilson, et autres
Publié: (2024)
TokAlign++: Advancing Vocabulary Adaptation via Better Token Alignment
par: Li, Chong, et autres
Publié: (2026)
par: Li, Chong, et autres
Publié: (2026)
HyperTokens: Controlling Token Dynamics for Continual Video-Language Understanding
par: Nguyen, Toan, et autres
Publié: (2026)
par: Nguyen, Toan, et autres
Publié: (2026)
Towards Quantifying the Preconditioning Effect of Adam
par: Das, Rudrajit, et autres
Publié: (2024)
par: Das, Rudrajit, et autres
Publié: (2024)
Documents similaires
-
Best of Both Worlds: Multimodal Reasoning and Generation via Unified Discrete Flow Matching
par: Susladkar, Onkar, et autres
Publié: (2026) -
RewardFlow: Generate Images by Optimizing What You Reward
par: Susladkar, Onkar, et autres
Publié: (2026) -
CALICO: Part-Focused Semantic Co-Segmentation with Large Vision-Language Models
par: Nguyen, Kiet A., et autres
Publié: (2024) -
Uncertainty in Action: Confidence Elicitation in Embodied Agents
par: Yu, Tianjiao, et autres
Publié: (2025) -
PRIMA: Multi-Image Vision-Language Models for Reasoning Segmentation
par: Wahed, Muntasir, et autres
Publié: (2024)