Riemann-based Multi-scale Attention Reasoning Network for Text-3D Retrieval
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Wenrui, Han, Wei, Chen, Yandu, Chai, Yeyu, Lu, Yidan, Wang, Xingtao, Fan, Xiaopeng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hyperbolic Hierarchical Alignment Reasoning Network for Text-3D Retrieval
par: Li, Wenrui, et autres
Publié: (2025)
par: Li, Wenrui, et autres
Publié: (2025)
SceneDreamer360: Text-Driven 3D-Consistent Scene Generation with Panoramic Gaussian Splatting
par: Li, Wenrui, et autres
Publié: (2024)
par: Li, Wenrui, et autres
Publié: (2024)
T-GVC: Trajectory-Guided Generative Video Coding at Ultra-Low Bitrates
par: Wang, Zhitao, et autres
Publié: (2025)
par: Wang, Zhitao, et autres
Publié: (2025)
SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding
par: Li, Wenrui, et autres
Publié: (2024)
par: Li, Wenrui, et autres
Publié: (2024)
STAR: Skeleton-aware Text-based 4D Avatar Generation with In-Network Motion Retargeting
par: Chai, Zenghao, et autres
Publié: (2024)
par: Chai, Zenghao, et autres
Publié: (2024)
Multi-scale Attention Guided Pose Transfer
par: Roy, Prasun, et autres
Publié: (2022)
par: Roy, Prasun, et autres
Publié: (2022)
MOC-3D: Manifold-Order Consistency for Text-to-3D Generation
par: Fan, Chenyang, et autres
Publié: (2026)
par: Fan, Chenyang, et autres
Publié: (2026)
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
par: Li, Wenrui, et autres
Publié: (2024)
par: Li, Wenrui, et autres
Publié: (2024)
Transcending Fusion: A Multi-Scale Alignment Method for Remote Sensing Image-Text Retrieval
par: Yang, Rui, et autres
Publié: (2024)
par: Yang, Rui, et autres
Publié: (2024)
Spatiotemporal Graph Guided Multi-modal Network for Livestreaming Product Retrieval
par: Hu, Xiaowan, et autres
Publié: (2024)
par: Hu, Xiaowan, et autres
Publié: (2024)
Digging into Intrinsic Contextual Information for High-fidelity 3D Point Cloud Completion
par: Chu, Jisheng, et autres
Publié: (2024)
par: Chu, Jisheng, et autres
Publié: (2024)
Representation Discrepancy Bridging Method for Remote Sensing Image-Text Retrieval
par: Ning, Hailong, et autres
Publié: (2025)
par: Ning, Hailong, et autres
Publié: (2025)
CAMeL: Cross-modality Adaptive Meta-Learning for Text-based Person Retrieval
par: Yu, Hang, et autres
Publié: (2025)
par: Yu, Hang, et autres
Publié: (2025)
Magic3DSketch: Create Colorful 3D Models From Sketch-Based 3D Modeling Guided by Text and Language-Image Pre-Training
par: Zang, Ying, et autres
Publié: (2024)
par: Zang, Ying, et autres
Publié: (2024)
VP3D: Unleashing 2D Visual Prompt for Text-to-3D Generation
par: Chen, Yang, et autres
Publié: (2024)
par: Chen, Yang, et autres
Publié: (2024)
Prompt-aware of Frame Sampling for Efficient Text-Video Retrieval
par: Zhang, Deyu, et autres
Publié: (2025)
par: Zhang, Deyu, et autres
Publié: (2025)
SNP-S3: Shared Network Pre-training and Significant Semantic Strengthening for Various Video-Text Tasks
par: Dong, Xingning, et autres
Publié: (2024)
par: Dong, Xingning, et autres
Publié: (2024)
Discrepancy-Aware Attention Network for Enhanced Audio-Visual Zero-Shot Learning
par: Yu, RunLin, et autres
Publié: (2024)
par: Yu, RunLin, et autres
Publié: (2024)
IDEA: Inverted Text with Cooperative Deformable Aggregation for Multi-modal Object Re-Identification
par: Wang, Yuhao, et autres
Publié: (2025)
par: Wang, Yuhao, et autres
Publié: (2025)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
par: Xie, Zequn, et autres
Publié: (2026)
par: Xie, Zequn, et autres
Publié: (2026)
Waymo-3DSkelMo: A Multi-Agent 3D Skeletal Motion Dataset for Pedestrian Interaction Modeling in Autonomous Driving
par: Zhu, Guangxun, et autres
Publié: (2025)
par: Zhu, Guangxun, et autres
Publié: (2025)
Zero-Shot Visual Grounding in 3D Gaussians via View Retrieval
par: Liao, Liwei, et autres
Publié: (2025)
par: Liao, Liwei, et autres
Publié: (2025)
Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
T2VParser: Adaptive Decomposition Tokens for Partial Alignment in Text to Video Retrieval
par: Li, Yili, et autres
Publié: (2025)
par: Li, Yili, et autres
Publié: (2025)
Cross-Modal and Uni-Modal Soft-Label Alignment for Image-Text Retrieval
par: Huang, Hailang, et autres
Publié: (2024)
par: Huang, Hailang, et autres
Publié: (2024)
Advancing 3D Scene Understanding with MV-ScanQA Multi-View Reasoning Evaluation and TripAlign Pre-training Dataset
par: Mo, Wentao, et autres
Publié: (2025)
par: Mo, Wentao, et autres
Publié: (2025)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding
par: Yang, Fan, et autres
Publié: (2025)
par: Yang, Fan, et autres
Publié: (2025)
Retrieving Any Relevant Moments: Benchmark and Models for Generalized Moment Retrieval
par: Ding, Yiming, et autres
Publié: (2026)
par: Ding, Yiming, et autres
Publié: (2026)
DreamMesh: Jointly Manipulating and Texturing Triangle Meshes for Text-to-3D Generation
par: Yang, Haibo, et autres
Publié: (2024)
par: Yang, Haibo, et autres
Publié: (2024)
Dual-Modal Attention-Enhanced Text-Video Retrieval with Triplet Partial Margin Contrastive Learning
par: Jiang, Chen, et autres
Publié: (2023)
par: Jiang, Chen, et autres
Publié: (2023)
Ego3DT: Tracking Every 3D Object in Ego-centric Videos
par: Hao, Shengyu, et autres
Publié: (2024)
par: Hao, Shengyu, et autres
Publié: (2024)
Efficient Vision Language Model Fine-tuning for Text-based Person Anomaly Search
par: He, Jiayi, et autres
Publié: (2025)
par: He, Jiayi, et autres
Publié: (2025)
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
par: Li, Yongqi, et autres
Publié: (2024)
par: Li, Yongqi, et autres
Publié: (2024)
Multi-proposal Collaboration and Multi-task Training for Weakly-supervised Video Moment Retrieval
par: Zhang, Bolin, et autres
Publié: (2026)
par: Zhang, Bolin, et autres
Publié: (2026)
Reasoning Like Experts: Leveraging Multimodal Large Language Models for Drawing-based Psychoanalysis
par: Ma, Xueqi, et autres
Publié: (2025)
par: Ma, Xueqi, et autres
Publié: (2025)
3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding
par: Li, Zeju, et autres
Publié: (2024)
par: Li, Zeju, et autres
Publié: (2024)
MoRAG -- Multi-Fusion Retrieval Augmented Generation for Human Motion
par: Kalakonda, Sai Shashank, et autres
Publié: (2024)
par: Kalakonda, Sai Shashank, et autres
Publié: (2024)
Synthetic Perception: Can Generated Images Unlock Latent Visual Prior for Text-Centric Reasoning?
par: Huang, Yuesheng, et autres
Publié: (2025)
par: Huang, Yuesheng, et autres
Publié: (2025)
PointCoT: A Multi-modal Benchmark for Explicit 3D Geometric Reasoning
par: Zhang, Dongxu, et autres
Publié: (2026)
par: Zhang, Dongxu, et autres
Publié: (2026)
Documents similaires
-
Hyperbolic Hierarchical Alignment Reasoning Network for Text-3D Retrieval
par: Li, Wenrui, et autres
Publié: (2025) -
SceneDreamer360: Text-Driven 3D-Consistent Scene Generation with Panoramic Gaussian Splatting
par: Li, Wenrui, et autres
Publié: (2024) -
T-GVC: Trajectory-Guided Generative Video Coding at Ultra-Low Bitrates
par: Wang, Zhitao, et autres
Publié: (2025) -
SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding
par: Li, Wenrui, et autres
Publié: (2024) -
STAR: Skeleton-aware Text-based 4D Avatar Generation with In-Network Motion Retargeting
par: Chai, Zenghao, et autres
Publié: (2024)