4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Chiao-An, Hachiuma, Ryo, Liu, Sifei, Radhakrishnan, Subhashree, Yeh, Raymond A., Wang, Yu-Chiang Frank, Chen, Min-Hung |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Omni-RGPT: Unifying Image and Video Region-level Understanding via Token Marks
por: Heo, Miran, et al.
Publicado: (2025)
por: Heo, Miran, et al.
Publicado: (2025)
Zoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-in
por: Shen, Xiaoqian, et al.
Publicado: (2025)
por: Shen, Xiaoqian, et al.
Publicado: (2025)
Masking Teacher and Reinforcing Student for Distilling Vision-Language Models
por: Lee, Byung-Kwan, et al.
Publicado: (2025)
por: Lee, Byung-Kwan, et al.
Publicado: (2025)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
por: Cheng, An-Chieh, et al.
Publicado: (2024)
por: Cheng, An-Chieh, et al.
Publicado: (2024)
Multi-Object 3D Grounding with Dynamic Modules and Language-Informed Spatial Attention
por: Zhang, Haomeng, et al.
Publicado: (2024)
por: Zhang, Haomeng, et al.
Publicado: (2024)
RealTraj: Towards Real-World Pedestrian Trajectory Forecasting
por: Fujii, Ryo, et al.
Publicado: (2024)
por: Fujii, Ryo, et al.
Publicado: (2024)
SANER: Annotation-free Societal Attribute Neutralizer for Debiasing CLIP
por: Hirota, Yusuke, et al.
Publicado: (2024)
por: Hirota, Yusuke, et al.
Publicado: (2024)
VIOLA: Towards Video In-Context Learning with Minimal Annotations
por: Fujii, Ryo, et al.
Publicado: (2026)
por: Fujii, Ryo, et al.
Publicado: (2026)
3D Aware Region Prompted Vision Language Model
por: Cheng, An-Chieh, et al.
Publicado: (2025)
por: Cheng, An-Chieh, et al.
Publicado: (2025)
Heatmap Regression without Soft-Argmax for Facial Landmark Detection
por: Yang, Chiao-An, et al.
Publicado: (2025)
por: Yang, Chiao-An, et al.
Publicado: (2025)
3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing
por: Zhen, Haoyu, et al.
Publicado: (2026)
por: Zhen, Haoyu, et al.
Publicado: (2026)
Towards Predicting Any Human Trajectory In Context
por: Fujii, Ryo, et al.
Publicado: (2025)
por: Fujii, Ryo, et al.
Publicado: (2025)
Toward Long-Tailed Online Anomaly Detection through Class-Agnostic Concepts
por: Yang, Chiao-An, et al.
Publicado: (2025)
por: Yang, Chiao-An, et al.
Publicado: (2025)
EMAG: Ego-motion Aware and Generalizable 2D Hand Forecasting from Egocentric Videos
por: Hatano, Masashi, et al.
Publicado: (2024)
por: Hatano, Masashi, et al.
Publicado: (2024)
FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding
por: Huang, De-An, et al.
Publicado: (2025)
por: Huang, De-An, et al.
Publicado: (2025)
Autoregressive Universal Video Segmentation Model
por: Heo, Miran, et al.
Publicado: (2025)
por: Heo, Miran, et al.
Publicado: (2025)
V2V-LLM: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models
por: Chiu, Hsu-kuang, et al.
Publicado: (2025)
por: Chiu, Hsu-kuang, et al.
Publicado: (2025)
Human Preference-Aligned Concept Customization Benchmark via Decomposed Evaluation
por: Ishikawa, Reina, et al.
Publicado: (2025)
por: Ishikawa, Reina, et al.
Publicado: (2025)
Deep Nets with Subsampling Layers Unwittingly Discard Useful Activations at Test-Time
por: Yang, Chiao-An, et al.
Publicado: (2024)
por: Yang, Chiao-An, et al.
Publicado: (2024)
Weakly Semi-supervised Tool Detection in Minimally Invasive Surgery Videos
por: Fujii, Ryo, et al.
Publicado: (2024)
por: Fujii, Ryo, et al.
Publicado: (2024)
CrowdMAC: Masked Crowd Density Completion for Robust Crowd Density Forecasting
por: Fujii, Ryo, et al.
Publicado: (2024)
por: Fujii, Ryo, et al.
Publicado: (2024)
Learning to Obstruct Few-Shot Image Classification over Restricted Classes
por: Zheng, Amber Yijia, et al.
Publicado: (2024)
por: Zheng, Amber Yijia, et al.
Publicado: (2024)
RegionGPT: Towards Region Understanding Vision Language Model
por: Guo, Qiushan, et al.
Publicado: (2024)
por: Guo, Qiushan, et al.
Publicado: (2024)
ShapeGen4D: Towards High Quality 4D Shape Generation from Videos
por: Yenphraphai, Jiraphon, et al.
Publicado: (2025)
por: Yenphraphai, Jiraphon, et al.
Publicado: (2025)
VLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
Unified Reinforcement and Imitation Learning for Vision-Language Models
por: Lee, Byung-Kwan, et al.
Publicado: (2025)
por: Lee, Byung-Kwan, et al.
Publicado: (2025)
Multimodal Cross-Domain Few-Shot Learning for Egocentric Action Recognition
por: Hatano, Masashi, et al.
Publicado: (2024)
por: Hatano, Masashi, et al.
Publicado: (2024)
Helix4D: Complex 4D Mesh Generation
por: Yenphraphai, Jiraphon, et al.
Publicado: (2026)
por: Yenphraphai, Jiraphon, et al.
Publicado: (2026)
DHQA-4D: Perceptual Quality Assessment of Dynamic 4D Digital Human
por: Li, Yunhao, et al.
Publicado: (2025)
por: Li, Yunhao, et al.
Publicado: (2025)
Predict-Optimize-Distill: A Self-Improving Cycle for 4D Object Understanding
por: Wu, Mingxuan, et al.
Publicado: (2025)
por: Wu, Mingxuan, et al.
Publicado: (2025)
Temporal Prompting Matters: Rethinking Referring Video Object Segmentation
por: Lin, Ci-Siang, et al.
Publicado: (2025)
por: Lin, Ci-Siang, et al.
Publicado: (2025)
GroPrompt: Efficient Grounded Prompting and Adaptation for Referring Video Object Segmentation
por: Lin, Ci-Siang, et al.
Publicado: (2024)
por: Lin, Ci-Siang, et al.
Publicado: (2024)
PartDistill: 3D Shape Part Segmentation by Vision-Language Model Distillation
por: Umam, Ardian, et al.
Publicado: (2023)
por: Umam, Ardian, et al.
Publicado: (2023)
Self-Improving 4D Perception via Self-Distillation
por: Huang, Nan, et al.
Publicado: (2026)
por: Huang, Nan, et al.
Publicado: (2026)
RGBD Objects in the Wild: Scaling Real-World 3D Object Learning from RGB-D Videos
por: Xia, Hongchi, et al.
Publicado: (2024)
por: Xia, Hongchi, et al.
Publicado: (2024)
GazeNLQ @ Ego4D Natural Language Queries Challenge 2025
por: Lin, Wei-Cheng, et al.
Publicado: (2025)
por: Lin, Wei-Cheng, et al.
Publicado: (2025)
Learning from Synthetic Data via Provenance-Based Input Gradient Guidance
por: Nagano, Koshiro, et al.
Publicado: (2026)
por: Nagano, Koshiro, et al.
Publicado: (2026)
From Descriptive Richness to Bias: Unveiling the Dark Side of Generative Image Caption Enrichment
por: Hirota, Yusuke, et al.
Publicado: (2024)
por: Hirota, Yusuke, et al.
Publicado: (2024)
Toward Scene Graph and Layout Guided Complex 3D Scene Generation
por: Huang, Yu-Hsiang, et al.
Publicado: (2024)
por: Huang, Yu-Hsiang, et al.
Publicado: (2024)
OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding
por: Huang, Sheng-Yu, et al.
Publicado: (2026)
por: Huang, Sheng-Yu, et al.
Publicado: (2026)
Ejemplares similares
-
Omni-RGPT: Unifying Image and Video Region-level Understanding via Token Marks
por: Heo, Miran, et al.
Publicado: (2025) -
Zoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-in
por: Shen, Xiaoqian, et al.
Publicado: (2025) -
Masking Teacher and Reinforcing Student for Distilling Vision-Language Models
por: Lee, Byung-Kwan, et al.
Publicado: (2025) -
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
por: Cheng, An-Chieh, et al.
Publicado: (2024) -
Multi-Object 3D Grounding with Dynamic Modules and Language-Informed Spatial Attention
por: Zhang, Haomeng, et al.
Publicado: (2024)