Referring to Any Person
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Qing, Wu, Lin, Zeng, Zhaoyang, Ren, Tianhe, Xiong, Yuda, Chen, Yihao, Liu, Qin, Zhang, Lei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ChatRex: Taming Multimodal LLM for Joint Perception and Understanding
di: Jiang, Qing, et al.
Pubblicazione: (2024)
di: Jiang, Qing, et al.
Pubblicazione: (2024)
Detect Anything via Next Point Prediction
di: Jiang, Qing, et al.
Pubblicazione: (2025)
di: Jiang, Qing, et al.
Pubblicazione: (2025)
TAPTRv3: Spatial and Temporal Context Foster Robust Tracking of Any Point in Long Video
di: Qu, Jinyuan, et al.
Pubblicazione: (2024)
di: Qu, Jinyuan, et al.
Pubblicazione: (2024)
TAPTR: Tracking Any Point with Transformers as Detection
di: Li, Hongyang, et al.
Pubblicazione: (2024)
di: Li, Hongyang, et al.
Pubblicazione: (2024)
T-Rex2: Towards Generic Object Detection via Text-Visual Prompt Synergy
di: Jiang, Qing, et al.
Pubblicazione: (2024)
di: Jiang, Qing, et al.
Pubblicazione: (2024)
TAPTRv2: Attention-based Position Update Improves Tracking Any Point
di: Li, Hongyang, et al.
Pubblicazione: (2024)
di: Li, Hongyang, et al.
Pubblicazione: (2024)
Grounding DINO 1.5: Advance the "Edge" of Open-Set Object Detection
di: Ren, Tianhe, et al.
Pubblicazione: (2024)
di: Ren, Tianhe, et al.
Pubblicazione: (2024)
Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning
di: Jiang, Qing, et al.
Pubblicazione: (2025)
di: Jiang, Qing, et al.
Pubblicazione: (2025)
Toward Generalized Image Quality Assessment: Relaxing the Perfect Reference Quality Assumption
di: Chen, Du, et al.
Pubblicazione: (2025)
di: Chen, Du, et al.
Pubblicazione: (2025)
DINO-X: A Unified Vision Model for Open-World Object Detection and Understanding
di: Ren, Tianhe, et al.
Pubblicazione: (2024)
di: Ren, Tianhe, et al.
Pubblicazione: (2024)
Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection
di: Liu, Shilong, et al.
Pubblicazione: (2023)
di: Liu, Shilong, et al.
Pubblicazione: (2023)
Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback
di: Li, Aiden Yiliu, et al.
Pubblicazione: (2025)
di: Li, Aiden Yiliu, et al.
Pubblicazione: (2025)
Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks
di: Ren, Tianhe, et al.
Pubblicazione: (2024)
di: Ren, Tianhe, et al.
Pubblicazione: (2024)
Decoupling What to Count and Where to See for Referring Expression Counting
di: Zou, Yuda, et al.
Pubblicazione: (2025)
di: Zou, Yuda, et al.
Pubblicazione: (2025)
Tarot-SAM3: Training-free SAM3 for Any Referring Expression Segmentation
di: Zhang, Weiming, et al.
Pubblicazione: (2026)
di: Zhang, Weiming, et al.
Pubblicazione: (2026)
X-Pose: Detecting Any Keypoints
di: Yang, Jie, et al.
Pubblicazione: (2023)
di: Yang, Jie, et al.
Pubblicazione: (2023)
Diversity-Preserved Distribution Matching Distillation for Fast Visual Synthesis
di: Wu, Tianhe, et al.
Pubblicazione: (2026)
di: Wu, Tianhe, et al.
Pubblicazione: (2026)
Segment Any Medical Model Extended
di: Liu, Yihao, et al.
Pubblicazione: (2024)
di: Liu, Yihao, et al.
Pubblicazione: (2024)
One2Any: One-Reference 6D Pose Estimation for Any Object
di: Liu, Mengya, et al.
Pubblicazione: (2025)
di: Liu, Mengya, et al.
Pubblicazione: (2025)
SwapAnyone: Consistent and Realistic Video Synthesis for Swapping Any Person into Any Video
di: Zhao, Chengshu, et al.
Pubblicazione: (2025)
di: Zhao, Chengshu, et al.
Pubblicazione: (2025)
InstantCharacter: Personalize Any Characters with a Scalable Diffusion Transformer Framework
di: Tao, Jiale, et al.
Pubblicazione: (2025)
di: Tao, Jiale, et al.
Pubblicazione: (2025)
OutfitAnyone: Ultra-high Quality Virtual Try-On for Any Clothing and Any Person
di: Sun, Ke, et al.
Pubblicazione: (2024)
di: Sun, Ke, et al.
Pubblicazione: (2024)
AnyAct: Towards Human Reenactment of Character Motion From Video
di: Chen, Liuhan, et al.
Pubblicazione: (2026)
di: Chen, Liuhan, et al.
Pubblicazione: (2026)
AnyAD: Unified Any-Modality Anomaly Detection in Incomplete Multi-Sequence MRI
di: Wu, Changwei, et al.
Pubblicazione: (2025)
di: Wu, Changwei, et al.
Pubblicazione: (2025)
VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank
di: Wu, Tianhe, et al.
Pubblicazione: (2025)
di: Wu, Tianhe, et al.
Pubblicazione: (2025)
A Comprehensive Study of Multimodal Large Language Models for Image Quality Assessment
di: Wu, Tianhe, et al.
Pubblicazione: (2024)
di: Wu, Tianhe, et al.
Pubblicazione: (2024)
Refer to Any Segmentation Mask Group With Vision-Language Prompts
di: Cao, Shengcao, et al.
Pubblicazione: (2025)
di: Cao, Shengcao, et al.
Pubblicazione: (2025)
Any2AnyTryon: Leveraging Adaptive Position Embeddings for Versatile Virtual Clothing Tasks
di: Guo, Hailong, et al.
Pubblicazione: (2025)
di: Guo, Hailong, et al.
Pubblicazione: (2025)
AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement
di: Zhong, Zhizhou, et al.
Pubblicazione: (2025)
di: Zhong, Zhizhou, et al.
Pubblicazione: (2025)
AnyID: Ultra-Fidelity Universal Identity-Preserving Video Generation from Any Visual References
di: Wang, Jiahao, et al.
Pubblicazione: (2026)
di: Wang, Jiahao, et al.
Pubblicazione: (2026)
SegDINO3D: 3D Instance Segmentation Empowered by Both Image-Level and Object-Level 2D Features
di: Qu, Jinyuan, et al.
Pubblicazione: (2025)
di: Qu, Jinyuan, et al.
Pubblicazione: (2025)
The Unanticipated Asymmetry Between Perceptual Optimization and Assessment
di: Zhang, Jiabei, et al.
Pubblicazione: (2025)
di: Zhang, Jiabei, et al.
Pubblicazione: (2025)
Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos
di: Lin, Weifeng, et al.
Pubblicazione: (2025)
di: Lin, Weifeng, et al.
Pubblicazione: (2025)
OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models
di: Chen, Jinshu, et al.
Pubblicazione: (2025)
di: Chen, Jinshu, et al.
Pubblicazione: (2025)
AnyDepth: Depth Estimation Made Easy
di: Ren, Zeyu, et al.
Pubblicazione: (2026)
di: Ren, Zeyu, et al.
Pubblicazione: (2026)
Personalized Cell Segmentation: Benchmark and Framework for Reference-Guided Cell Type Segmentation
di: Wang, Bisheng, et al.
Pubblicazione: (2026)
di: Wang, Bisheng, et al.
Pubblicazione: (2026)
Implicit Discriminative Knowledge Learning for Visible-Infrared Person Re-Identification
di: Ren, Kaijie, et al.
Pubblicazione: (2024)
di: Ren, Kaijie, et al.
Pubblicazione: (2024)
AniDoc: Animation Creation Made Easier
di: Meng, Yihao, et al.
Pubblicazione: (2024)
di: Meng, Yihao, et al.
Pubblicazione: (2024)
AnyArtisticGlyph: Multilingual Controllable Artistic Glyph Generation
di: Lu, Xiongbo, et al.
Pubblicazione: (2025)
di: Lu, Xiongbo, et al.
Pubblicazione: (2025)
FysicsWorld: A Unified Full-Modality Benchmark for Any-to-Any Understanding, Generation, and Reasoning
di: Jiang, Yue, et al.
Pubblicazione: (2025)
di: Jiang, Yue, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ChatRex: Taming Multimodal LLM for Joint Perception and Understanding
di: Jiang, Qing, et al.
Pubblicazione: (2024) -
Detect Anything via Next Point Prediction
di: Jiang, Qing, et al.
Pubblicazione: (2025) -
TAPTRv3: Spatial and Temporal Context Foster Robust Tracking of Any Point in Long Video
di: Qu, Jinyuan, et al.
Pubblicazione: (2024) -
TAPTR: Tracking Any Point with Transformers as Detection
di: Li, Hongyang, et al.
Pubblicazione: (2024) -
T-Rex2: Towards Generic Object Detection via Text-Visual Prompt Synergy
di: Jiang, Qing, et al.
Pubblicazione: (2024)