ChatterBox: Multi-round Multimodal Referring and Grounding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tian, Yunjie, Ma, Tianren, Xie, Lingxi, Qiu, Jihao, Tang, Xi, Zhang, Yuan, Jiao, Jianbin, Tian, Qi, Ye, Qixiang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Adaptive Keyframe Sampling for Long Video Understanding
par: Tang, Xi, et autres
Publié: (2025)
par: Tang, Xi, et autres
Publié: (2025)
Fast-iTPN: Integrally Pre-Trained Transformer Pyramid Network with Token Migration
par: Tian, Yunjie, et autres
Publié: (2022)
par: Tian, Yunjie, et autres
Publié: (2022)
ClawMachine: Learning to Fetch Visual Tokens for Referential Comprehension
par: Ma, Tianren, et autres
Publié: (2024)
par: Ma, Tianren, et autres
Publié: (2024)
Artemis: Towards Referential Understanding in Complex Videos
par: Qiu, Jihao, et autres
Publié: (2024)
par: Qiu, Jihao, et autres
Publié: (2024)
LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding
par: Qiu, Jihao, et autres
Publié: (2026)
par: Qiu, Jihao, et autres
Publié: (2026)
VMamba: Visual State Space Model
par: Liu, Yue, et autres
Publié: (2024)
par: Liu, Yue, et autres
Publié: (2024)
YOLOv12: Attention-Centric Real-Time Object Detectors
par: Tian, Yunjie, et autres
Publié: (2025)
par: Tian, Yunjie, et autres
Publié: (2025)
Spatial Transform Decoupling for Oriented Object Detection
par: Yu, Hongtian, et autres
Publié: (2023)
par: Yu, Hongtian, et autres
Publié: (2023)
AceTone: Bridging Words and Colors for Conditional Image Grading
par: Ma, Tianren, et autres
Publié: (2026)
par: Ma, Tianren, et autres
Publié: (2026)
ChatterBox: A Full-Stack MERN + Socket.IO Architecture for Secure and Scalable Real-Time Messaging Systems
par: Soni, Saurabh, et autres
Publié: (2025)
par: Soni, Saurabh, et autres
Publié: (2025)
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
par: He, Xin, et autres
Publié: (2024)
par: He, Xin, et autres
Publié: (2024)
Self-supervised Feature-Gate Coupling for Dynamic Network Pruning
par: Shi, Mengnan, et autres
Publié: (2021)
par: Shi, Mengnan, et autres
Publié: (2021)
Uncertainty-guided Optimal Transport in Depth Supervised Sparse-View 3D Gaussian
par: Sun, Wei, et autres
Publié: (2024)
par: Sun, Wei, et autres
Publié: (2024)
Depth-guided Texture Diffusion for Image Semantic Segmentation
par: Sun, Wei, et autres
Publié: (2024)
par: Sun, Wei, et autres
Publié: (2024)
ReDDiT: Rehashing Noise for Discrete Visual Generation
par: Ma, Tianren, et autres
Publié: (2025)
par: Ma, Tianren, et autres
Publié: (2025)
Mixpert: Mitigating Multimodal Learning Conflicts with Efficient Mixture-of-Vision-Experts
par: He, Xin, et autres
Publié: (2025)
par: He, Xin, et autres
Publié: (2025)
Building Vision Models upon Heat Conduction
par: Wang, Zhaozhi, et autres
Publié: (2024)
par: Wang, Zhaozhi, et autres
Publié: (2024)
EMMA: Efficient Multimodal Understanding, Generation, and Editing with a Unified Architecture
par: He, Xin, et autres
Publié: (2025)
par: He, Xin, et autres
Publié: (2025)
Consolidating Reinforcement Learning for Multimodal Discrete Diffusion Models
par: Ma, Tianren, et autres
Publié: (2025)
par: Ma, Tianren, et autres
Publié: (2025)
Correspondence-Guided SfM-Free 3D Gaussian Splatting for NVS
par: Sun, Wei, et autres
Publié: (2024)
par: Sun, Wei, et autres
Publié: (2024)
OVMR: Open-Vocabulary Recognition with Multi-Modal References
par: Ma, Zehong, et autres
Publié: (2024)
par: Ma, Zehong, et autres
Publié: (2024)
GaussianEditor: Editing 3D Gaussians Delicately with Text Instructions
par: Wang, Junjie, et autres
Publié: (2023)
par: Wang, Junjie, et autres
Publié: (2023)
DynRefer: Delving into Region-level Multimodal Tasks via Dynamic Resolution
par: Zhao, Yuzhong, et autres
Publié: (2024)
par: Zhao, Yuzhong, et autres
Publié: (2024)
Parameter Efficient Fine-tuning via Cross Block Orchestration for Segment Anything Model
par: Peng, Zelin, et autres
Publié: (2023)
par: Peng, Zelin, et autres
Publié: (2023)
P2Object: Single Point Supervised Object Detection and Instance Segmentation
par: Chen, Pengfei, et autres
Publié: (2025)
par: Chen, Pengfei, et autres
Publié: (2025)
AlignZeg: Mitigating Objective Misalignment for Zero-shot Semantic Segmentation
par: Ge, Jiannan, et autres
Publié: (2024)
par: Ge, Jiannan, et autres
Publié: (2024)
ClickTrack: Towards Real-time Interactive Single Object Tracking
par: Wang, Kuiran, et autres
Publié: (2024)
par: Wang, Kuiran, et autres
Publié: (2024)
CPR++: Object Localization via Single Coarse Point Supervision
par: Yu, Xuehui, et autres
Publié: (2024)
par: Yu, Xuehui, et autres
Publié: (2024)
Rethinking Sampling Strategies for Unsupervised Person Re-identification
par: Han, Xumeng, et autres
Publié: (2021)
par: Han, Xumeng, et autres
Publié: (2021)
Rethinking Two-Stage Referring-by-Tracking in Referring Multi-Object Tracking: Make it Strong Again
par: Li, Weize, et autres
Publié: (2025)
par: Li, Weize, et autres
Publié: (2025)
Text-Animator: Controllable Visual Text Video Generation
par: Liu, Lin, et autres
Publié: (2024)
par: Liu, Lin, et autres
Publié: (2024)
Multimodal Reference Visual Grounding
par: Lu, Yangxiao, et autres
Publié: (2025)
par: Lu, Yangxiao, et autres
Publié: (2025)
Segment Any 3D Gaussians
par: Cen, Jiazhong, et autres
Publié: (2023)
par: Cen, Jiazhong, et autres
Publié: (2023)
MetaLab: Few-Shot Game Changer for Image Recognition
par: Qi, Chaofei, et autres
Publié: (2025)
par: Qi, Chaofei, et autres
Publié: (2025)
Color as the Impetus: Transforming Few-Shot Learner
par: Qi, Chaofei, et autres
Publié: (2025)
par: Qi, Chaofei, et autres
Publié: (2025)
E-4DGS: High-Fidelity Dynamic Reconstruction from the Multi-view Event Cameras
par: Feng, Chaoran, et autres
Publié: (2025)
par: Feng, Chaoran, et autres
Publié: (2025)
Shallow Deep Learning Can Still Excel in Fine-Grained Few-Shot Learning
par: Qi, Chaofei, et autres
Publié: (2025)
par: Qi, Chaofei, et autres
Publié: (2025)
Task-Focused Memorization for Multimodal Agents
par: Zou, Tao, et autres
Publié: (2026)
par: Zou, Tao, et autres
Publié: (2026)
MF2Summ: Multimodal Fusion for Video Summarization with Temporal Alignment
par: wang, Shuo, et autres
Publié: (2025)
par: wang, Shuo, et autres
Publié: (2025)
REVEAL: Reference-Grounded Reasoning for Multimodal Manipulation Detection
par: Zhou, Jun, et autres
Publié: (2026)
par: Zhou, Jun, et autres
Publié: (2026)
Documents similaires
-
Adaptive Keyframe Sampling for Long Video Understanding
par: Tang, Xi, et autres
Publié: (2025) -
Fast-iTPN: Integrally Pre-Trained Transformer Pyramid Network with Token Migration
par: Tian, Yunjie, et autres
Publié: (2022) -
ClawMachine: Learning to Fetch Visual Tokens for Referential Comprehension
par: Ma, Tianren, et autres
Publié: (2024) -
Artemis: Towards Referential Understanding in Complex Videos
par: Qiu, Jihao, et autres
Publié: (2024) -
LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding
par: Qiu, Jihao, et autres
Publié: (2026)