Guardado en:
| Autores principales: | Zhang, Tongtong, Wei, Xian, Li, Yuanxiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2404.00544 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Nerf-Based Color Consistency Method for Remote Sensing Images
por: Zuo, Zongcheng, et al.
Publicado: (2024)
por: Zuo, Zongcheng, et al.
Publicado: (2024)
psPRF:Pansharpening Planar Neural Radiance Field for Generalized 3D Reconstruction Satellite Imagery
por: Zhang, Tongtong, et al.
Publicado: (2024)
por: Zhang, Tongtong, et al.
Publicado: (2024)
Online LiDAR-Camera Extrinsic Parameters Self-checking
por: Wei, Pengjin, et al.
Publicado: (2022)
por: Wei, Pengjin, et al.
Publicado: (2022)
Proximal Vision Transformer: Enhancing Feature Representation through Two-Stage Manifold Geometry
por: Yun, Haoyu, et al.
Publicado: (2025)
por: Yun, Haoyu, et al.
Publicado: (2025)
Surface Vision Mamba: Leveraging Bidirectional State Space Model for Efficient Spherical Manifold Representation
por: He, Rongzhao, et al.
Publicado: (2025)
por: He, Rongzhao, et al.
Publicado: (2025)
Superpixel Semantics Representation and Pre-training for Vision-Language Task
por: Zhang, Siyu, et al.
Publicado: (2023)
por: Zhang, Siyu, et al.
Publicado: (2023)
Environment-Driven Online LiDAR-Camera Extrinsic Calibration
por: Huang, Zhiwei, et al.
Publicado: (2025)
por: Huang, Zhiwei, et al.
Publicado: (2025)
MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations
por: Zhang, Ziyang, et al.
Publicado: (2025)
por: Zhang, Ziyang, et al.
Publicado: (2025)
Improved Belief-Attention in Vision Task
por: Zhang, Guoqiang
Publicado: (2026)
por: Zhang, Guoqiang
Publicado: (2026)
ZSPAPrune: Zero-Shot Prompt-Aware Token Pruning for Vision-Language Models
por: Zhang, Pu, et al.
Publicado: (2025)
por: Zhang, Pu, et al.
Publicado: (2025)
Generalized Single-Image-Based Morphing Attack Detection Using Deep Representations from Vision Transformer
por: Zhang, Haoyu, et al.
Publicado: (2025)
por: Zhang, Haoyu, et al.
Publicado: (2025)
PMMD: A pose-guided multi-view multi-modal diffusion for person generation
por: Shang, Ziyu, et al.
Publicado: (2025)
por: Shang, Ziyu, et al.
Publicado: (2025)
NuWa: Deriving Lightweight Task-Specific Vision Transformers for Edge Devices
por: Wei, Ziteng, et al.
Publicado: (2025)
por: Wei, Ziteng, et al.
Publicado: (2025)
Deep Active Learning with Manifold-preserving Trajectory Sampling
por: Ji, Yingrui, et al.
Publicado: (2024)
por: Ji, Yingrui, et al.
Publicado: (2024)
LLaVA-OneVision: Easy Visual Task Transfer
por: Li, Bo, et al.
Publicado: (2024)
por: Li, Bo, et al.
Publicado: (2024)
UniGaussian: Driving Scene Reconstruction from Multiple Camera Models via Unified Gaussian Representations
por: Ren, Yuan, et al.
Publicado: (2024)
por: Ren, Yuan, et al.
Publicado: (2024)
Dynamic Universal Approximation Theory: The Basic Theory for Deep Learning-Based Computer Vision Models
por: Wang, Wei, et al.
Publicado: (2024)
por: Wang, Wei, et al.
Publicado: (2024)
Compressing Vision Transformers in Geospatial Transfer Learning with Manifold-Constrained Optimization
por: Snyder, Thomas, et al.
Publicado: (2026)
por: Snyder, Thomas, et al.
Publicado: (2026)
UNIC: Learning Unified Multimodal Extrinsic Contact Estimation
por: Xu, Zhengtong, et al.
Publicado: (2026)
por: Xu, Zhengtong, et al.
Publicado: (2026)
Efficient Terrain Stochastic Differential Efficient Terrain Stochastic Differential Equations for Multipurpose Digital Elevation Model Restoration
por: Zhang, Tongtong, et al.
Publicado: (2024)
por: Zhang, Tongtong, et al.
Publicado: (2024)
Two-Stream Interactive Joint Learning of Scene Parsing and Geometric Vision Tasks
por: Tang, Guanfeng, et al.
Publicado: (2026)
por: Tang, Guanfeng, et al.
Publicado: (2026)
Masked Modeling for Self-supervised Representation Learning on Vision and Beyond
por: Li, Siyuan, et al.
Publicado: (2023)
por: Li, Siyuan, et al.
Publicado: (2023)
Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress
por: Zhang, Yuelin, et al.
Publicado: (2026)
por: Zhang, Yuelin, et al.
Publicado: (2026)
Olympus: A Universal Task Router for Computer Vision Tasks
por: Lin, Yuanze, et al.
Publicado: (2024)
por: Lin, Yuanze, et al.
Publicado: (2024)
Human-Like Coarse Object Representations in Vision Models
por: Gizdov, Andrey, et al.
Publicado: (2026)
por: Gizdov, Andrey, et al.
Publicado: (2026)
TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types
por: Chen, Jiankang, et al.
Publicado: (2025)
por: Chen, Jiankang, et al.
Publicado: (2025)
GTMA: Dynamic Representation Optimization for OOD Vision-Language Models
por: Zhang, Jensen, et al.
Publicado: (2025)
por: Zhang, Jensen, et al.
Publicado: (2025)
Research on the Application of Computer Vision Based on Deep Learning in Autonomous Driving Technology
por: Zhang, Jingyu, et al.
Publicado: (2024)
por: Zhang, Jingyu, et al.
Publicado: (2024)
Global Geometry Is Not Enough for Vision Representations
por: Chung, Jiwan, et al.
Publicado: (2026)
por: Chung, Jiwan, et al.
Publicado: (2026)
Behavior-Grounded Lane Representation Learning for Multi-Task Traffic Digital Twins
por: Tamaru, Rei, et al.
Publicado: (2026)
por: Tamaru, Rei, et al.
Publicado: (2026)
SurgeryV2: Bridging the Gap Between Model Merging and Multi-Task Learning with Deep Representation Surgery
por: Yang, Enneng, et al.
Publicado: (2024)
por: Yang, Enneng, et al.
Publicado: (2024)
Online,Target-Free LiDAR-Camera Extrinsic Calibration via Cross-Modal Mask Matching
por: Huang, Zhiwei, et al.
Publicado: (2024)
por: Huang, Zhiwei, et al.
Publicado: (2024)
Representation Separation for Semantic Segmentation with Vision Transformers
por: Hong, Yuanduo, et al.
Publicado: (2022)
por: Hong, Yuanduo, et al.
Publicado: (2022)
The Geometry of Representational Failures in Vision Language Models
por: Savietto, Daniele, et al.
Publicado: (2026)
por: Savietto, Daniele, et al.
Publicado: (2026)
SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments
por: Jiang, Wen, et al.
Publicado: (2026)
por: Jiang, Wen, et al.
Publicado: (2026)
PyVision-RL: Forging Open Agentic Vision Models via RL
por: Zhao, Shitian, et al.
Publicado: (2026)
por: Zhao, Shitian, et al.
Publicado: (2026)
Learning Emergent Modular Representations in Multi-modality Medical Vision Foundation Models
por: He, Yuting, et al.
Publicado: (2026)
por: He, Yuting, et al.
Publicado: (2026)
PhyVLLM: Physics-Guided Video Language Model with Motion-Appearance Disentanglement
por: Zhan, Yu-Wei, et al.
Publicado: (2025)
por: Zhan, Yu-Wei, et al.
Publicado: (2025)
LVLM-Aided Alignment of Task-Specific Vision Models
por: Koebler, Alexander, et al.
Publicado: (2025)
por: Koebler, Alexander, et al.
Publicado: (2025)
Demystifying KAN for Vision Tasks: The RepKAN Approach
por: Cheon, Minjong
Publicado: (2026)
por: Cheon, Minjong
Publicado: (2026)
Ejemplares similares
-
A Nerf-Based Color Consistency Method for Remote Sensing Images
por: Zuo, Zongcheng, et al.
Publicado: (2024) -
psPRF:Pansharpening Planar Neural Radiance Field for Generalized 3D Reconstruction Satellite Imagery
por: Zhang, Tongtong, et al.
Publicado: (2024) -
Online LiDAR-Camera Extrinsic Parameters Self-checking
por: Wei, Pengjin, et al.
Publicado: (2022) -
Proximal Vision Transformer: Enhancing Feature Representation through Two-Stage Manifold Geometry
por: Yun, Haoyu, et al.
Publicado: (2025) -
Surface Vision Mamba: Leveraging Bidirectional State Space Model for Efficient Spherical Manifold Representation
por: He, Rongzhao, et al.
Publicado: (2025)