Perceptual Group Tokenizer: Building Perception with Iterative Grouping
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Deng, Zhiwei, Chen, Ting, Li, Yang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Scaling Image Tokenizers with Grouped Spherical Quantization
von: Wang, Jiangtao, et al.
Veröffentlicht: (2024)
von: Wang, Jiangtao, et al.
Veröffentlicht: (2024)
Beyond BEV: Optimizing Point-Level Tokens for Collaborative Perception
von: Li, Yang, et al.
Veröffentlicht: (2025)
von: Li, Yang, et al.
Veröffentlicht: (2025)
VISA: Group-wise Visual Token Selection and Aggregation via Graph Summarization for Efficient MLLMs Inference
von: Jiang, Pengfei, et al.
Veröffentlicht: (2025)
von: Jiang, Pengfei, et al.
Veröffentlicht: (2025)
OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
von: Li, Geng, et al.
Veröffentlicht: (2026)
von: Li, Geng, et al.
Veröffentlicht: (2026)
GroupCoOp: Group-robust Fine-tuning via Group Prompt Learning
von: Kim, Nayeong, et al.
Veröffentlicht: (2025)
von: Kim, Nayeong, et al.
Veröffentlicht: (2025)
GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models
von: Huang, Mingzhe, et al.
Veröffentlicht: (2026)
von: Huang, Mingzhe, et al.
Veröffentlicht: (2026)
Predicting and Enhancing the Fairness of DNNs with the Curvature of Perceptual Manifolds
von: Ma, Yanbiao, et al.
Veröffentlicht: (2023)
von: Ma, Yanbiao, et al.
Veröffentlicht: (2023)
InfBaGel: Human-Object-Scene Interaction Generation with Dynamic Perception and Iterative Refinement
von: Zou, Yude, et al.
Veröffentlicht: (2026)
von: Zou, Yude, et al.
Veröffentlicht: (2026)
BudgetFusion: Perceptually-Guided Adaptive Diffusion Models
von: Li, Qinchan, et al.
Veröffentlicht: (2024)
von: Li, Qinchan, et al.
Veröffentlicht: (2024)
VideoMiner: Iteratively Grounding Key Frames of Hour-Long Videos via Tree-based Group Relative Policy Optimization
von: Cao, Xinye, et al.
Veröffentlicht: (2025)
von: Cao, Xinye, et al.
Veröffentlicht: (2025)
Learning from Disagreement: A Group Decision Simulation Framework for Robust Medical Image Segmentation
von: Zhong, Chen, et al.
Veröffentlicht: (2025)
von: Zhong, Chen, et al.
Veröffentlicht: (2025)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
von: Wang, Xinhao, et al.
Veröffentlicht: (2026)
von: Wang, Xinhao, et al.
Veröffentlicht: (2026)
MoCHA: Advanced Vision-Language Reasoning with MoE Connector and Hierarchical Group Attention
von: Pang, Yuqi, et al.
Veröffentlicht: (2025)
von: Pang, Yuqi, et al.
Veröffentlicht: (2025)
Online Iterative Self-Alignment for Radiology Report Generation
von: Xiao, Ting, et al.
Veröffentlicht: (2025)
von: Xiao, Ting, et al.
Veröffentlicht: (2025)
Advanced Sign Language Video Generation with Compressed and Quantized Multi-Condition Tokenization
von: Wang, Cong, et al.
Veröffentlicht: (2025)
von: Wang, Cong, et al.
Veröffentlicht: (2025)
Perceptio: Perception Enhanced Vision Language Models via Spatial Token Generation
von: Li, Yuchen, et al.
Veröffentlicht: (2026)
von: Li, Yuchen, et al.
Veröffentlicht: (2026)
Probing Perceptual Constancy in Large Vision-Language Models
von: Sun, Haoran, et al.
Veröffentlicht: (2025)
von: Sun, Haoran, et al.
Veröffentlicht: (2025)
PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding
von: Wang, Nan, et al.
Veröffentlicht: (2026)
von: Wang, Nan, et al.
Veröffentlicht: (2026)
Unveiling and Mitigating Generalized Biases of DNNs through the Intrinsic Dimensions of Perceptual Manifolds
von: Ma, Yanbiao, et al.
Veröffentlicht: (2024)
von: Ma, Yanbiao, et al.
Veröffentlicht: (2024)
TokenUnify: Scaling Up Autoregressive Pretraining for Neuron Segmentation
von: Chen, Yinda, et al.
Veröffentlicht: (2024)
von: Chen, Yinda, et al.
Veröffentlicht: (2024)
MaMe & MaRe: Matrix-Based Token Merging and Restoration for Efficient Visual Perception and Synthesis
von: Huo, Simin, et al.
Veröffentlicht: (2026)
von: Huo, Simin, et al.
Veröffentlicht: (2026)
Robust Adverse Weather Removal via Spectral-based Spatial Grouping
von: Jeong, Yuhwan, et al.
Veröffentlicht: (2025)
von: Jeong, Yuhwan, et al.
Veröffentlicht: (2025)
ACPO: Anchor-Constrained Perceptual Optimization for Diffusion Models with No-Reference Quality Guidance
von: Yang, Yang, et al.
Veröffentlicht: (2026)
von: Yang, Yang, et al.
Veröffentlicht: (2026)
Scaling-up Perceptual Video Quality Assessment
von: Jia, Ziheng, et al.
Veröffentlicht: (2025)
von: Jia, Ziheng, et al.
Veröffentlicht: (2025)
Multi-Focused Video Group Activities Hashing
von: Qi, Zhongmiao, et al.
Veröffentlicht: (2025)
von: Qi, Zhongmiao, et al.
Veröffentlicht: (2025)
Unified and Dynamic Graph for Temporal Character Grouping in Long Videos
von: Shu, Xiujun, et al.
Veröffentlicht: (2023)
von: Shu, Xiujun, et al.
Veröffentlicht: (2023)
PTQAT: A Hybrid Parameter-Efficient Quantization Algorithm for 3D Perception Tasks
von: Wang, Xinhao, et al.
Veröffentlicht: (2025)
von: Wang, Xinhao, et al.
Veröffentlicht: (2025)
Enhancing Long Video Question Answering with Scene-Localized Frame Grouping
von: Yang, Xuyi, et al.
Veröffentlicht: (2025)
von: Yang, Xuyi, et al.
Veröffentlicht: (2025)
Towards Self-Improvement of Diffusion Models via Group Preference Optimization
von: Chen, Renjie, et al.
Veröffentlicht: (2025)
von: Chen, Renjie, et al.
Veröffentlicht: (2025)
Object-Centric Vision Token Pruning for Vision Language Models
von: Li, Guangyuan, et al.
Veröffentlicht: (2025)
von: Li, Guangyuan, et al.
Veröffentlicht: (2025)
Enhancing Shape Perception and Segmentation Consistency for Industrial Image Inspection
von: Mao, Guoxuan, et al.
Veröffentlicht: (2025)
von: Mao, Guoxuan, et al.
Veröffentlicht: (2025)
Diffusion Model with Perceptual Loss
von: Lin, Shanchuan, et al.
Veröffentlicht: (2023)
von: Lin, Shanchuan, et al.
Veröffentlicht: (2023)
Mastering Negation: Boosting Grounding Models via Grouped Opposition-Based Learning
von: Yang, Zesheng, et al.
Veröffentlicht: (2026)
von: Yang, Zesheng, et al.
Veröffentlicht: (2026)
Group Orthogonalization Regularization For Vision Models Adaptation and Robustness
von: Kurtz, Yoav, et al.
Veröffentlicht: (2023)
von: Kurtz, Yoav, et al.
Veröffentlicht: (2023)
Multi-Group Proportional Representation for Text-to-Image Models
von: Jung, Sangwon, et al.
Veröffentlicht: (2025)
von: Jung, Sangwon, et al.
Veröffentlicht: (2025)
Renormalization Group Guided Tensor Network Structure Search
von: Wang, Maolin, et al.
Veröffentlicht: (2025)
von: Wang, Maolin, et al.
Veröffentlicht: (2025)
Multi-Scale Grouped Prototypes for Interpretable Semantic Segmentation
von: Porta, Hugo, et al.
Veröffentlicht: (2024)
von: Porta, Hugo, et al.
Veröffentlicht: (2024)
Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding
von: Wang, Ziyang, et al.
Veröffentlicht: (2025)
von: Wang, Ziyang, et al.
Veröffentlicht: (2025)
TAGE: Trustworthy Attribute Group Editing for Stable Few-shot Image Generation
von: Zhang, Ruicheng, et al.
Veröffentlicht: (2024)
von: Zhang, Ruicheng, et al.
Veröffentlicht: (2024)
Latent Guidance in Diffusion Models for Perceptual Evaluations
von: Saini, Shreshth, et al.
Veröffentlicht: (2025)
von: Saini, Shreshth, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Scaling Image Tokenizers with Grouped Spherical Quantization
von: Wang, Jiangtao, et al.
Veröffentlicht: (2024) -
Beyond BEV: Optimizing Point-Level Tokens for Collaborative Perception
von: Li, Yang, et al.
Veröffentlicht: (2025) -
VISA: Group-wise Visual Token Selection and Aggregation via Graph Summarization for Efficient MLLMs Inference
von: Jiang, Pengfei, et al.
Veröffentlicht: (2025) -
OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
von: Li, Geng, et al.
Veröffentlicht: (2026) -
GroupCoOp: Group-robust Fine-tuning via Group Prompt Learning
von: Kim, Nayeong, et al.
Veröffentlicht: (2025)