Guardado en:
| Autores principales: | Ren, Tianhe, Liu, Shilong, Zeng, Ailing, Lin, Jing, Li, Kunchang, Cao, He, Chen, Jiayu, Huang, Xinyu, Chen, Yukang, Yan, Feng, Zeng, Zhaoyang, Zhang, Hao, Li, Feng, Yang, Jie, Li, Hongyang, Jiang, Qing, Zhang, Lei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2401.14159 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
T-Rex2: Towards Generic Object Detection via Text-Visual Prompt Synergy
por: Jiang, Qing, et al.
Publicado: (2024)
por: Jiang, Qing, et al.
Publicado: (2024)
TAPTR: Tracking Any Point with Transformers as Detection
por: Li, Hongyang, et al.
Publicado: (2024)
por: Li, Hongyang, et al.
Publicado: (2024)
TAPTRv2: Attention-based Position Update Improves Tracking Any Point
por: Li, Hongyang, et al.
Publicado: (2024)
por: Li, Hongyang, et al.
Publicado: (2024)
Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection
por: Liu, Shilong, et al.
Publicado: (2023)
por: Liu, Shilong, et al.
Publicado: (2023)
TAPTRv3: Spatial and Temporal Context Foster Robust Tracking of Any Point in Long Video
por: Qu, Jinyuan, et al.
Publicado: (2024)
por: Qu, Jinyuan, et al.
Publicado: (2024)
Grounding DINO 1.5: Advance the "Edge" of Open-Set Object Detection
por: Ren, Tianhe, et al.
Publicado: (2024)
por: Ren, Tianhe, et al.
Publicado: (2024)
Open-World Human-Object Interaction Detection via Multi-modal Prompts
por: Yang, Jie, et al.
Publicado: (2024)
por: Yang, Jie, et al.
Publicado: (2024)
DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding
por: Ren, Tianhe, et al.
Publicado: (2024)
por: Ren, Tianhe, et al.
Publicado: (2024)
Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback
por: Li, Aiden Yiliu, et al.
Publicado: (2025)
por: Li, Aiden Yiliu, et al.
Publicado: (2025)
SegDINO3D: 3D Instance Segmentation Empowered by Both Image-Level and Object-Level 2D Features
por: Qu, Jinyuan, et al.
Publicado: (2025)
por: Qu, Jinyuan, et al.
Publicado: (2025)
VRP-SAM: SAM with Visual Reference Prompt
por: Sun, Yanpeng, et al.
Publicado: (2024)
por: Sun, Yanpeng, et al.
Publicado: (2024)
ChatRex: Taming Multimodal LLM for Joint Perception and Understanding
por: Jiang, Qing, et al.
Publicado: (2024)
por: Jiang, Qing, et al.
Publicado: (2024)
Referring to Any Person
por: Jiang, Qing, et al.
Publicado: (2025)
por: Jiang, Qing, et al.
Publicado: (2025)
Detect Anything via Next Point Prediction
por: Jiang, Qing, et al.
Publicado: (2025)
por: Jiang, Qing, et al.
Publicado: (2025)
Diversity-Preserved Distribution Matching Distillation for Fast Visual Synthesis
por: Wu, Tianhe, et al.
Publicado: (2026)
por: Wu, Tianhe, et al.
Publicado: (2026)
Wanderland: Geometrically Grounded Simulation for Open-World Embodied AI
por: Liu, Xinhao, et al.
Publicado: (2025)
por: Liu, Xinhao, et al.
Publicado: (2025)
Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning
por: Jiang, Qing, et al.
Publicado: (2025)
por: Jiang, Qing, et al.
Publicado: (2025)
Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation
por: Zhang, Yabo, et al.
Publicado: (2026)
por: Zhang, Yabo, et al.
Publicado: (2026)
A Reconstruction of the Neutrino Nature and a Unified Explanation of Related Puzzles Based on the Great Tao Model
por: Zeng, Jiqing, et al.
Publicado: (2026)
por: Zeng, Jiqing, et al.
Publicado: (2026)
The Existence Field Theory of the Great Tao Model: Establishment of the Vacuum-Medium Unified Field Equations
por: Zeng, Jiqing, et al.
Publicado: (2026)
por: Zeng, Jiqing, et al.
Publicado: (2026)
Percept, Chat, and then Adapt: Multimodal Knowledge Transfer of Foundation Models for Open-World Video Recognition
por: Chen, Boyu, et al.
Publicado: (2024)
por: Chen, Boyu, et al.
Publicado: (2024)
GSAlign: Geometric and Semantic Alignment Network for Aerial-Ground Person Re-Identification
por: Li, Qiao, et al.
Publicado: (2025)
por: Li, Qiao, et al.
Publicado: (2025)
X-Pose: Detecting Any Keypoints
por: Yang, Jie, et al.
Publicado: (2023)
por: Yang, Jie, et al.
Publicado: (2023)
Visual Programming for Zero-shot Open-Vocabulary 3D Visual Grounding
por: Yuan, Zhihao, et al.
Publicado: (2023)
por: Yuan, Zhihao, et al.
Publicado: (2023)
Enhanced Fast Switching of Viologen‐Based Electrochromics Using Hybrid Electrolytes
por: Ying Ma, et al.
Publicado: (2026)
por: Ying Ma, et al.
Publicado: (2026)
DSM: Constructing a Diverse Semantic Map for 3D Visual Grounding
por: Xie, Qinghongbing, et al.
Publicado: (2025)
por: Xie, Qinghongbing, et al.
Publicado: (2025)
Imaging and Polarimetric Signatures of Konoplya-Zhidenko Black Holes with Various Thick Disk
por: Wang, Xinyu, et al.
Publicado: (2025)
por: Wang, Xinyu, et al.
Publicado: (2025)
VQ-VA World: Towards High-Quality Visual Question-Visual Answering
por: Gou, Chenhui, et al.
Publicado: (2025)
por: Gou, Chenhui, et al.
Publicado: (2025)
Moving Toward Best Practice When Using Propensity Score Weighting in Survey Observational Studies
por: Yukang Zeng, et al.
Publicado: (2026)
por: Yukang Zeng, et al.
Publicado: (2026)
Moving toward best practice when using propensity score weighting in survey observational studies
por: Zeng, Yukang, et al.
Publicado: (2025)
por: Zeng, Yukang, et al.
Publicado: (2025)
LMM-Track4D: Eliciting 4D Dynamic Reasoning in LMMs via Trajectory-Grounded Dialogue
por: Li, Chaoyue, et al.
Publicado: (2026)
por: Li, Chaoyue, et al.
Publicado: (2026)
AlignSAM: Aligning Segment Anything Model to Open Context via Reinforcement Learning
por: Huang, Duojun, et al.
Publicado: (2024)
por: Huang, Duojun, et al.
Publicado: (2024)
Adversarial Exploitation of Data Diversity Improves Visual Localization
por: Li, Sihang, et al.
Publicado: (2024)
por: Li, Sihang, et al.
Publicado: (2024)
AssemPlanner: A Multi-Agent Based Task Planning Framework for Flexible Assembly System
por: Zhang, Chenhao, et al.
Publicado: (2026)
por: Zhang, Chenhao, et al.
Publicado: (2026)
MDReID: Modality-Decoupled Learning for Any-to-Any Multi-Modal Object Re-Identification
por: Feng, Yingying, et al.
Publicado: (2025)
por: Feng, Yingying, et al.
Publicado: (2025)
Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO
por: Ren, Yiming, et al.
Publicado: (2026)
por: Ren, Yiming, et al.
Publicado: (2026)
Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection
por: Zhuang, Weijun, et al.
Publicado: (2025)
por: Zhuang, Weijun, et al.
Publicado: (2025)
Multi-LVI-SAM: A Robust LiDAR-Visual-Inertial Odometry for Multiple Fisheye Cameras
por: Zhang, Xinyu, et al.
Publicado: (2025)
por: Zhang, Xinyu, et al.
Publicado: (2025)
Less Signals, More Understanding: Channel-Capacity Codebook Design for Digital Task-Oriented Semantic Communication
por: Zhang, Anbang, et al.
Publicado: (2025)
por: Zhang, Anbang, et al.
Publicado: (2025)
VideoSAM: Open-World Video Segmentation
por: Guo, Pinxue, et al.
Publicado: (2024)
por: Guo, Pinxue, et al.
Publicado: (2024)
Ejemplares similares
-
T-Rex2: Towards Generic Object Detection via Text-Visual Prompt Synergy
por: Jiang, Qing, et al.
Publicado: (2024) -
TAPTR: Tracking Any Point with Transformers as Detection
por: Li, Hongyang, et al.
Publicado: (2024) -
TAPTRv2: Attention-based Position Update Improves Tracking Any Point
por: Li, Hongyang, et al.
Publicado: (2024) -
Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection
por: Liu, Shilong, et al.
Publicado: (2023) -
TAPTRv3: Spatial and Temporal Context Foster Robust Tracking of Any Point in Long Video
por: Qu, Jinyuan, et al.
Publicado: (2024)