Guardado en:
| Autores principales: | Deng, Xueqing, Yu, Qihang, Athar, Ali, Yang, Chenglin, Yang, Linjie, Jin, Xiaojie, Shen, Xiaohui, Chen, Liang-Chieh |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2502.02589 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
COCONut: Modernizing COCO Segmentation
por: Deng, Xueqing, et al.
Publicado: (2024)
por: Deng, Xueqing, et al.
Publicado: (2024)
ViCaS: A Dataset for Combining Holistic and Pixel-level Video Understanding using Captions with Grounded Segmentation
por: Athar, Ali, et al.
Publicado: (2024)
por: Athar, Ali, et al.
Publicado: (2024)
Randomized Autoregressive Visual Generation
por: Yu, Qihang, et al.
Publicado: (2024)
por: Yu, Qihang, et al.
Publicado: (2024)
A Simple Video Segmenter by Tracking Objects Along Axial Trajectories
por: He, Ju, et al.
Publicado: (2023)
por: He, Ju, et al.
Publicado: (2023)
PanDepth: Joint Panoptic Segmentation and Depth Completion
por: Lagos, Juan, et al.
Publicado: (2022)
por: Lagos, Juan, et al.
Publicado: (2022)
1.58-bit FLUX
por: Yang, Chenglin, et al.
Publicado: (2024)
por: Yang, Chenglin, et al.
Publicado: (2024)
An Image is Worth 32 Tokens for Reconstruction and Generation
por: Yu, Qihang, et al.
Publicado: (2024)
por: Yu, Qihang, et al.
Publicado: (2024)
MaskBit: Embedding-free Image Generation via Bit Tokens
por: Weber, Mark, et al.
Publicado: (2024)
por: Weber, Mark, et al.
Publicado: (2024)
Democratizing Text-to-Image Masked Generative Models with Compact Text-Aware One-Dimensional Tokens
por: Kim, Dongwon, et al.
Publicado: (2025)
por: Kim, Dongwon, et al.
Publicado: (2025)
FingerCap: Fine-grained Finger-level Hand Motion Captioning
por: Shen, Xin, et al.
Publicado: (2025)
por: Shen, Xin, et al.
Publicado: (2025)
PanORama: Multiview Consistent Panoptic Segmentation in Operating Rooms
por: Gürbüz, Tuna, et al.
Publicado: (2026)
por: Gürbüz, Tuna, et al.
Publicado: (2026)
PanSR: An Object-Centric Mask Transformer for Panoptic Segmentation
por: Žust, Lojze, et al.
Publicado: (2024)
por: Žust, Lojze, et al.
Publicado: (2024)
PanDA: Unsupervised Domain Adaptation for Multimodal 3D Panoptic Segmentation in Autonomous Driving
por: Pan, Yining, et al.
Publicado: (2026)
por: Pan, Yining, et al.
Publicado: (2026)
GroundCap: A Visually Grounded Image Captioning Dataset
por: Oliveira, Daniel A. P., et al.
Publicado: (2025)
por: Oliveira, Daniel A. P., et al.
Publicado: (2025)
PanSt3R: Multi-view Consistent Panoptic Segmentation
por: Zust, Lojze, et al.
Publicado: (2025)
por: Zust, Lojze, et al.
Publicado: (2025)
CompCap: Improving Multimodal Large Language Models with Composite Captions
por: Chen, Xiaohui, et al.
Publicado: (2024)
por: Chen, Xiaohui, et al.
Publicado: (2024)
SPORTS: Simultaneous Panoptic Odometry, Rendering, Tracking and Segmentation for Urban Scenes Understanding
por: Yang, Zhiliu, et al.
Publicado: (2025)
por: Yang, Zhiliu, et al.
Publicado: (2025)
FSAR-Cap: A Fine-Grained Two-Stage Annotated Dataset for SAR Image Captioning
por: Zhang, Jinqi, et al.
Publicado: (2025)
por: Zhang, Jinqi, et al.
Publicado: (2025)
CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding
por: Zheng, Lihao, et al.
Publicado: (2026)
por: Zheng, Lihao, et al.
Publicado: (2026)
ViTamin: Designing Scalable Vision Models in the Vision-Language Era
por: Chen, Jieneng, et al.
Publicado: (2024)
por: Chen, Jieneng, et al.
Publicado: (2024)
PanopticPartFormer++: A Unified and Decoupled View for Panoptic Part Segmentation
por: Li, Xiangtai, et al.
Publicado: (2023)
por: Li, Xiangtai, et al.
Publicado: (2023)
Panoptic Captioning: An Equivalence Bridge for Image and Text
por: Lin, Kun-Yu, et al.
Publicado: (2025)
por: Lin, Kun-Yu, et al.
Publicado: (2025)
Enhancing Temporal Consistency in Video Editing by Reconstructing Videos with 3D Gaussian Splatting
por: Shin, Inkyu, et al.
Publicado: (2024)
por: Shin, Inkyu, et al.
Publicado: (2024)
Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning
por: Zhang, Xu, et al.
Publicado: (2026)
por: Zhang, Xu, et al.
Publicado: (2026)
VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction Editing Data and Long Captions
por: Wang, Ziteng, et al.
Publicado: (2025)
por: Wang, Ziteng, et al.
Publicado: (2025)
VoCap: Video Object Captioning and Segmentation from Any Prompt
por: Uijlings, Jasper, et al.
Publicado: (2025)
por: Uijlings, Jasper, et al.
Publicado: (2025)
ProCap: Projection-Aware Captioning for Spatial Augmented Reality
por: Cao, Zimo, et al.
Publicado: (2026)
por: Cao, Zimo, et al.
Publicado: (2026)
MC-PanDA: Mask Confidence for Panoptic Domain Adaptation
por: Martinović, Ivan, et al.
Publicado: (2024)
por: Martinović, Ivan, et al.
Publicado: (2024)
Beyond Next-Token: Next-X Prediction for Autoregressive Visual Generation
por: Ren, Sucheng, et al.
Publicado: (2025)
por: Ren, Sucheng, et al.
Publicado: (2025)
Frequency-Aware Flow Matching for High-Quality Image Generation
por: Ren, Sucheng, et al.
Publicado: (2026)
por: Ren, Sucheng, et al.
Publicado: (2026)
Alleviating Distortion in Image Generation via Multi-Resolution Diffusion Models and Time-Dependent Layer Normalization
por: Liu, Qihao, et al.
Publicado: (2024)
por: Liu, Qihao, et al.
Publicado: (2024)
FlowAR: Scale-wise Autoregressive Image Generation Meets Flow Matching
por: Ren, Sucheng, et al.
Publicado: (2024)
por: Ren, Sucheng, et al.
Publicado: (2024)
Deeply Supervised Flow-Based Generative Models
por: Shin, Inkyu, et al.
Publicado: (2025)
por: Shin, Inkyu, et al.
Publicado: (2025)
IG Captioner: Information Gain Captioners are Strong Zero-shot Classifiers
por: Yang, Chenglin, et al.
Publicado: (2023)
por: Yang, Chenglin, et al.
Publicado: (2023)
Video ReCap: Recursive Captioning of Hour-Long Videos
por: Islam, Md Mohaiminul, et al.
Publicado: (2024)
por: Islam, Md Mohaiminul, et al.
Publicado: (2024)
Rational Design Strategies in DNA‐Encoded Libraries for Drug Discovery
por: Xudong Wang, et al.
Publicado: (2025)
por: Xudong Wang, et al.
Publicado: (2025)
COCO-OLAC: A Benchmark for Occluded Panoptic Segmentation and Image Understanding
por: Wei, Wenbo, et al.
Publicado: (2024)
por: Wei, Wenbo, et al.
Publicado: (2024)
ArtiMuse: Fine-Grained Image Aesthetics Assessment with Joint Scoring and Expert-Level Understanding
por: Cao, Shuo, et al.
Publicado: (2025)
por: Cao, Shuo, et al.
Publicado: (2025)
CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval
por: Xu, Yifan, et al.
Publicado: (2024)
por: Xu, Yifan, et al.
Publicado: (2024)
Open-World Panoptic Segmentation
por: Sodano, Matteo, et al.
Publicado: (2024)
por: Sodano, Matteo, et al.
Publicado: (2024)
Ejemplares similares
-
COCONut: Modernizing COCO Segmentation
por: Deng, Xueqing, et al.
Publicado: (2024) -
ViCaS: A Dataset for Combining Holistic and Pixel-level Video Understanding using Captions with Grounded Segmentation
por: Athar, Ali, et al.
Publicado: (2024) -
Randomized Autoregressive Visual Generation
por: Yu, Qihang, et al.
Publicado: (2024) -
A Simple Video Segmenter by Tracking Objects Along Axial Trajectories
por: He, Ju, et al.
Publicado: (2023) -
PanDepth: Joint Panoptic Segmentation and Depth Completion
por: Lagos, Juan, et al.
Publicado: (2022)