Synthetic Object Compositions for Scalable and Accurate Learning in Detection, Segmentation, and Grounding
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Weikai, Zhang, Jieyu, Jia, Taoyang, Zheng, Chenhao, Gao, Ziqi, Park, Jae Sung, Han, Winson, Krishna, Ranjay |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Synthetic Visual Genome 2: Extracting Large-scale Spatio-Temporal Scene Graphs from Videos
di: Gao, Ziqi, et al.
Pubblicazione: (2026)
di: Gao, Ziqi, et al.
Pubblicazione: (2026)
Iterated Learning Improves Compositionality in Large Vision-Language Models
di: Zheng, Chenhao, et al.
Pubblicazione: (2024)
di: Zheng, Chenhao, et al.
Pubblicazione: (2024)
Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training
di: Gao, Ziqi, et al.
Pubblicazione: (2024)
di: Gao, Ziqi, et al.
Pubblicazione: (2024)
One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory
di: Zheng, Chenhao, et al.
Pubblicazione: (2025)
di: Zheng, Chenhao, et al.
Pubblicazione: (2025)
MolmoPoint: Better Pointing for VLMs with Grounding Tokens
di: Clark, Christopher, et al.
Pubblicazione: (2026)
di: Clark, Christopher, et al.
Pubblicazione: (2026)
m&m's: A Benchmark to Evaluate Tool-Use for multi-step multi-modal Tasks
di: Ma, Zixian, et al.
Pubblicazione: (2024)
di: Ma, Zixian, et al.
Pubblicazione: (2024)
TrajTok: Learning Trajectory Tokens enables better Video Understanding
di: Zheng, Chenhao, et al.
Pubblicazione: (2026)
di: Zheng, Chenhao, et al.
Pubblicazione: (2026)
WildDet3D: Scaling Promptable 3D Detection in the Wild
di: Huang, Weikai, et al.
Pubblicazione: (2026)
di: Huang, Weikai, et al.
Pubblicazione: (2026)
Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding
di: Clark, Christopher, et al.
Pubblicazione: (2026)
di: Clark, Christopher, et al.
Pubblicazione: (2026)
Synthetic Visual Genome
di: Park, Jae Sung, et al.
Pubblicazione: (2025)
di: Park, Jae Sung, et al.
Pubblicazione: (2025)
Visual Representations inside the Language Model
di: Liu, Benlin, et al.
Pubblicazione: (2025)
di: Liu, Benlin, et al.
Pubblicazione: (2025)
Unified Spatio-Temporal Token Scoring for Efficient Video VLMs
di: Zhang, Jianrui, et al.
Pubblicazione: (2026)
di: Zhang, Jianrui, et al.
Pubblicazione: (2026)
GraspMolmo: Generalizable Task-Oriented Grasping via Large-Scale Synthetic Data Generation
di: Deshpande, Abhay, et al.
Pubblicazione: (2025)
di: Deshpande, Abhay, et al.
Pubblicazione: (2025)
You Only Judge Once: Multi-response Reward Modeling in a Single Forward Pass
di: Yang, Yinuo, et al.
Pubblicazione: (2026)
di: Yang, Yinuo, et al.
Pubblicazione: (2026)
Task Me Anything
di: Zhang, Jieyu, et al.
Pubblicazione: (2024)
di: Zhang, Jieyu, et al.
Pubblicazione: (2024)
Towards Acyclic Preference Evaluation of Language Models via Multiple Evaluators
di: Hu, Zhengyu, et al.
Pubblicazione: (2024)
di: Hu, Zhengyu, et al.
Pubblicazione: (2024)
Posterior Augmented Flow Matching
di: Stoica, George, et al.
Pubblicazione: (2026)
di: Stoica, George, et al.
Pubblicazione: (2026)
Mask Grounding for Referring Image Segmentation
di: Chng, Yong Xien, et al.
Pubblicazione: (2023)
di: Chng, Yong Xien, et al.
Pubblicazione: (2023)
GRAVITY: A Framework for Personalized Text Generation via Profile-Grounded Synthetic Preferences
di: Dey, Priyanka, et al.
Pubblicazione: (2025)
di: Dey, Priyanka, et al.
Pubblicazione: (2025)
ActionAtlas: A VideoQA Benchmark for Domain-specialized Action Recognition
di: Salehi, Mohammadreza, et al.
Pubblicazione: (2024)
di: Salehi, Mohammadreza, et al.
Pubblicazione: (2024)
Video-Based Reward Modeling for Computer-Use Agents
di: Song, Linxin, et al.
Pubblicazione: (2026)
di: Song, Linxin, et al.
Pubblicazione: (2026)
SnAG: Scalable and Accurate Video Grounding
di: Mu, Fangzhou, et al.
Pubblicazione: (2024)
di: Mu, Fangzhou, et al.
Pubblicazione: (2024)
Offline Training of Language Model Agents with Functions as Learnable Weights
di: Zhang, Shaokun, et al.
Pubblicazione: (2024)
di: Zhang, Shaokun, et al.
Pubblicazione: (2024)
The Hard Positive Truth about Vision-Language Compositionality
di: Kamath, Amita, et al.
Pubblicazione: (2024)
di: Kamath, Amita, et al.
Pubblicazione: (2024)
The Physical Accessibility of Public Libraries to Users: A GIS Study
di: Park, Sung Jae
Pubblicazione: (2011)
di: Park, Sung Jae
Pubblicazione: (2011)
SPARO: Selective Attention for Robust and Compositional Transformer Encodings for Vision
di: Vani, Ankit, et al.
Pubblicazione: (2024)
di: Vani, Ankit, et al.
Pubblicazione: (2024)
Synthetic-to-Real Camouflaged Object Detection
di: Luo, Zhihao, et al.
Pubblicazione: (2025)
di: Luo, Zhihao, et al.
Pubblicazione: (2025)
EAGLE: Eigen Aggregation Learning for Object-Centric Unsupervised Semantic Segmentation
di: Kim, Chanyoung, et al.
Pubblicazione: (2024)
di: Kim, Chanyoung, et al.
Pubblicazione: (2024)
Reward Dimension Reduction for Scalable Multi-Objective Reinforcement Learning
di: Park, Giseung, et al.
Pubblicazione: (2025)
di: Park, Giseung, et al.
Pubblicazione: (2025)
VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition
di: Yadav, Tanush, et al.
Pubblicazione: (2026)
di: Yadav, Tanush, et al.
Pubblicazione: (2026)
Temporal Grounding as a Learning Signal for Referring Video Object Segmentation
di: Lee, Seunghun, et al.
Pubblicazione: (2025)
di: Lee, Seunghun, et al.
Pubblicazione: (2025)
Lookback Lens: Detecting and Mitigating Contextual Hallucinations in Large Language Models Using Only Attention Maps
di: Chuang, Yung-Sung, et al.
Pubblicazione: (2024)
di: Chuang, Yung-Sung, et al.
Pubblicazione: (2024)
ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models
di: Zhang, Jieyu, et al.
Pubblicazione: (2024)
di: Zhang, Jieyu, et al.
Pubblicazione: (2024)
Self-Enhancing Video Data Management System for Compositional Events with Large Language Models [Technical Report]
di: Zhang, Enhao, et al.
Pubblicazione: (2024)
di: Zhang, Enhao, et al.
Pubblicazione: (2024)
MutaGReP: Execution-Free Repository-Grounded Plan Search for Code-Use
di: Khan, Zaid, et al.
Pubblicazione: (2025)
di: Khan, Zaid, et al.
Pubblicazione: (2025)
Videoshop: Localized Semantic Video Editing with Noise-Extrapolated Diffusion Inversion
di: Fan, Xiang, et al.
Pubblicazione: (2024)
di: Fan, Xiang, et al.
Pubblicazione: (2024)
Ablate-to-Validate: Are Vision-Language Models Really Using Continuous Thought Tokens?
di: Zhang, Tianyi, et al.
Pubblicazione: (2026)
di: Zhang, Tianyi, et al.
Pubblicazione: (2026)
LEGION: Learning to Ground and Explain for Synthetic Image Detection
di: Kang, Hengrui, et al.
Pubblicazione: (2025)
di: Kang, Hengrui, et al.
Pubblicazione: (2025)
Incremental Label Distribution Learning with Scalable Graph Convolutional Networks
di: Jia, Ziqi, et al.
Pubblicazione: (2024)
di: Jia, Ziqi, et al.
Pubblicazione: (2024)
Enhancing Object Discovery for Unsupervised Instance Segmentation and Object Detection
di: Feng, Xingyu, et al.
Pubblicazione: (2025)
di: Feng, Xingyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Synthetic Visual Genome 2: Extracting Large-scale Spatio-Temporal Scene Graphs from Videos
di: Gao, Ziqi, et al.
Pubblicazione: (2026) -
Iterated Learning Improves Compositionality in Large Vision-Language Models
di: Zheng, Chenhao, et al.
Pubblicazione: (2024) -
Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training
di: Gao, Ziqi, et al.
Pubblicazione: (2024) -
One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory
di: Zheng, Chenhao, et al.
Pubblicazione: (2025) -
MolmoPoint: Better Pointing for VLMs with Grounding Tokens
di: Clark, Christopher, et al.
Pubblicazione: (2026)