Enregistré dans:
| Auteurs principaux: | Liu, Yang, Chen, Binglin, Zheng, Yongsen, Cheng, Lechao, Li, Guanbin, Lin, Liang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2404.15734 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cross-modal Causal Relation Alignment for Video Question Grounding
par: Chen, Weixing, et autres
Publié: (2025)
par: Chen, Weixing, et autres
Publié: (2025)
Beyond the Destination: A Novel Benchmark for Exploration-Aware Embodied Question Answering
par: Jiang, Kaixuan, et autres
Publié: (2025)
par: Jiang, Kaixuan, et autres
Publié: (2025)
MarvelOVD: Marrying Object Recognition and Vision-Language Models for Robust Open-Vocabulary Object Detection
par: Wang, Kuo, et autres
Publié: (2024)
par: Wang, Kuo, et autres
Publié: (2024)
Dual-domain Adaptation Networks for Realistic Image Super-resolution
par: Fang, Chaowei, et autres
Publié: (2025)
par: Fang, Chaowei, et autres
Publié: (2025)
GUIDED: Granular Understanding via Identification, Detection, and Discrimination for Fine-Grained Open-Vocabulary Object Detection
par: Li, Jiaming, et autres
Publié: (2026)
par: Li, Jiaming, et autres
Publié: (2026)
Decoupled Training with Local Reinforcement Fine-Tuning in Federated Learning
par: Ma, Yuting, et autres
Publié: (2026)
par: Ma, Yuting, et autres
Publié: (2026)
DDP-WM: Disentangled Dynamics Prediction for Efficient World Models
par: Yin, Shicheng, et autres
Publié: (2026)
par: Yin, Shicheng, et autres
Publié: (2026)
Cross-Modal Causal Intervention for Medical Report Generation
par: Chen, Weixing, et autres
Publié: (2023)
par: Chen, Weixing, et autres
Publié: (2023)
Towards Long-Horizon Vision-Language Navigation: Platform, Benchmark and Method
par: Song, Xinshuai, et autres
Publié: (2024)
par: Song, Xinshuai, et autres
Publié: (2024)
evMLP: An Efficient Event-Driven MLP Architecture for Vision
par: Zheng, Zhentan
Publié: (2025)
par: Zheng, Zhentan
Publié: (2025)
TadML: A fast temporal action detection with Mechanics-MLP
par: Deng, Bowen, et autres
Publié: (2022)
par: Deng, Bowen, et autres
Publié: (2022)
Towards Fine-Grained Emotion Understanding via Skeleton-Based Micro-Gesture Recognition
par: Xu, Hao, et autres
Publié: (2025)
par: Xu, Hao, et autres
Publié: (2025)
3DAffordSplat: Efficient Affordance Reasoning with 3D Gaussians
par: Wei, Zeming, et autres
Publié: (2025)
par: Wei, Zeming, et autres
Publié: (2025)
Credible Teacher for Semi-Supervised Object Detection in Open Scene
par: Zhuang, Jingyu, et autres
Publié: (2024)
par: Zhuang, Jingyu, et autres
Publié: (2024)
MLP Can Be A Good Transformer Learner
par: Lin, Sihao, et autres
Publié: (2024)
par: Lin, Sihao, et autres
Publié: (2024)
Self-Prophetic Decoding to Unlock Visual Search in LVLMs
par: He, Zhendong, et autres
Publié: (2026)
par: He, Zhendong, et autres
Publié: (2026)
Efficient Vision Language Model Fine-tuning for Text-based Person Anomaly Search
par: He, Jiayi, et autres
Publié: (2025)
par: He, Jiayi, et autres
Publié: (2025)
DSPNet: Dual-vision Scene Perception for Robust 3D Question Answering
par: Luo, Jingzhou, et autres
Publié: (2025)
par: Luo, Jingzhou, et autres
Publié: (2025)
One Model for All: Unified Try-On and Try-Off in Any Pose via LLM-Inspired Bidirectional Tweedie Diffusion
par: Liu, Jinxi, et autres
Publié: (2025)
par: Liu, Jinxi, et autres
Publié: (2025)
DenoiseGS: Gaussian Reconstruction Model for Burst Denoising
par: Cheng, Yongsen, et autres
Publié: (2025)
par: Cheng, Yongsen, et autres
Publié: (2025)
FUSU: A Multi-temporal-source Land Use Change Segmentation Dataset for Fine-grained Urban Semantic Understanding
par: Yuan, Shuai, et autres
Publié: (2024)
par: Yuan, Shuai, et autres
Publié: (2024)
MEIA: Multimodal Embodied Perception and Interaction in Unknown Environments
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
Novel Class Discovery for Ultra-Fine-Grained Visual Categorization
par: Liu, Yu, et autres
Publié: (2024)
par: Liu, Yu, et autres
Publié: (2024)
Sim-DETR: Unlock DETR for Temporal Sentence Grounding
par: Tang, Jiajin, et autres
Publié: (2025)
par: Tang, Jiajin, et autres
Publié: (2025)
StgcDiff: Spatial-Temporal Graph Condition Diffusion for Sign Language Transition Generation
par: He, Jiashu, et autres
Publié: (2025)
par: He, Jiashu, et autres
Publié: (2025)
Are VLMs Lost Between Sky and Space? LinkS$^2$Bench for UAV-Satellite Dynamic Cross-View Spatial Intelligence
par: Liu, Dian, et autres
Publié: (2026)
par: Liu, Dian, et autres
Publié: (2026)
LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation
par: Ning, Yuwei, et autres
Publié: (2026)
par: Ning, Yuwei, et autres
Publié: (2026)
Fine-grained Dynamic Network for Generic Event Boundary Detection
par: Zheng, Ziwei, et autres
Publié: (2024)
par: Zheng, Ziwei, et autres
Publié: (2024)
High-fidelity and Lip-synced Talking Face Synthesis via Landmark-based Diffusion Model
par: Zhong, Weizhi, et autres
Publié: (2024)
par: Zhong, Weizhi, et autres
Publié: (2024)
Focus Anywhere for Fine-grained Multi-page Document Understanding
par: Liu, Chenglong, et autres
Publié: (2024)
par: Liu, Chenglong, et autres
Publié: (2024)
ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning
par: Zhang, Yiming, et autres
Publié: (2026)
par: Zhang, Yiming, et autres
Publié: (2026)
SpiralMLP: A Lightweight Vision MLP Architecture
par: Mu, Haojie, et autres
Publié: (2024)
par: Mu, Haojie, et autres
Publié: (2024)
SpatialLM: Training Large Language Models for Structured Indoor Modeling
par: Mao, Yongsen, et autres
Publié: (2025)
par: Mao, Yongsen, et autres
Publié: (2025)
Learning Background Prompts to Discover Implicit Knowledge for Open Vocabulary Object Detection
par: Li, Jiaming, et autres
Publié: (2024)
par: Li, Jiaming, et autres
Publié: (2024)
DAGSM: Disentangled Avatar Generation with GS-enhanced Mesh
par: Zhuang, Jingyu, et autres
Publié: (2024)
par: Zhuang, Jingyu, et autres
Publié: (2024)
WildVidFit: Video Virtual Try-On in the Wild via Image-Based Controlled Diffusion Models
par: He, Zijian, et autres
Publié: (2024)
par: He, Zijian, et autres
Publié: (2024)
Modality Alignment Meets Federated Broadcasting
par: Ma, Yuting, et autres
Publié: (2024)
par: Ma, Yuting, et autres
Publié: (2024)
TDEdit: A Unified Diffusion Framework for Text-Drag Guided Image Manipulation
par: Wang, Qihang, et autres
Publié: (2025)
par: Wang, Qihang, et autres
Publié: (2025)
Recovering Origin Destination Flows from Bus CCTV: Early Results from Nairobi and Kigali
par: Kyatha, Nthenya, et autres
Publié: (2025)
par: Kyatha, Nthenya, et autres
Publié: (2025)
FineParser: A Fine-grained Spatio-temporal Action Parser for Human-centric Action Quality Assessment
par: Xu, Jinglin, et autres
Publié: (2024)
par: Xu, Jinglin, et autres
Publié: (2024)
Documents similaires
-
Cross-modal Causal Relation Alignment for Video Question Grounding
par: Chen, Weixing, et autres
Publié: (2025) -
Beyond the Destination: A Novel Benchmark for Exploration-Aware Embodied Question Answering
par: Jiang, Kaixuan, et autres
Publié: (2025) -
MarvelOVD: Marrying Object Recognition and Vision-Language Models for Robust Open-Vocabulary Object Detection
par: Wang, Kuo, et autres
Publié: (2024) -
Dual-domain Adaptation Networks for Realistic Image Super-resolution
par: Fang, Chaowei, et autres
Publié: (2025) -
GUIDED: Granular Understanding via Identification, Detection, and Discrimination for Fine-Grained Open-Vocabulary Object Detection
par: Li, Jiaming, et autres
Publié: (2026)