XNet v2: Fewer Limitations, Better Results and Greater Universality
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Yanfeng, Li, Lingrui, Wang, Zichen, Liu, Guole, Liu, Ziwen, Yang, Ge |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Partial Channel Network: Compute Fewer, Perform Better
par: Huang, Haiduo, et autres
Publié: (2025)
par: Huang, Haiduo, et autres
Publié: (2025)
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
par: Chen, Shimin, et autres
Publié: (2024)
par: Chen, Shimin, et autres
Publié: (2024)
Underwater Camouflaged Object Tracking Meets Vision-Language SAM2
par: Zhang, Chunhui, et autres
Publié: (2024)
par: Zhang, Chunhui, et autres
Publié: (2024)
Scaling Artificial Intelligence for Multi-Tumor Early Detection with More Reports, Fewer Masks
par: Bassi, Pedro R. A. S., et autres
Publié: (2025)
par: Bassi, Pedro R. A. S., et autres
Publié: (2025)
Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning
par: Ge, Yuyao, et autres
Publié: (2025)
par: Ge, Yuyao, et autres
Publié: (2025)
All in One: Exploring Unified Vision-Language Tracking with Multi-Modal Alignment
par: Zhang, Chunhui, et autres
Publié: (2023)
par: Zhang, Chunhui, et autres
Publié: (2023)
MoiréXNet: Adaptive Multi-Scale Demoiréing with Linear Attention Test-Time Training and Truncated Flow Matching Prior
par: Li, Liangyan, et autres
Publié: (2025)
par: Li, Liangyan, et autres
Publié: (2025)
Few and Fewer: Learning Better from Few Examples Using Fewer Base Classes
par: Lafargue, Raphael, et autres
Publié: (2024)
par: Lafargue, Raphael, et autres
Publié: (2024)
Awesome Multi-modal Object Tracking
par: Zhang, Chunhui, et autres
Publié: (2024)
par: Zhang, Chunhui, et autres
Publié: (2024)
COST: Contrastive One-Stage Transformer for Vision-Language Small Object Tracking
par: Zhang, Chunhui, et autres
Publié: (2025)
par: Zhang, Chunhui, et autres
Publié: (2025)
UniHM: Universal Human Motion Generation with Object Interactions in Indoor Scenes
par: Geng, Zichen, et autres
Publié: (2025)
par: Geng, Zichen, et autres
Publié: (2025)
From Fewer Samples to Fewer Bits: Reframing Dataset Distillation as Joint Optimization of Precision and Compactness
par: Dinh, My H., et autres
Publié: (2026)
par: Dinh, My H., et autres
Publié: (2026)
WebUOT-1M: Advancing Deep Underwater Object Tracking with A Million-Scale Benchmark
par: Zhang, Chunhui, et autres
Publié: (2024)
par: Zhang, Chunhui, et autres
Publié: (2024)
PKI: Prior Knowledge-Infused Neural Network for Few-Shot Class-Incremental Learning
par: Baoa, Kexin, et autres
Publié: (2026)
par: Baoa, Kexin, et autres
Publié: (2026)
SwiftBrush v2: Make Your One-step Diffusion Model Better Than Its Teacher
par: Dao, Trung, et autres
Publié: (2024)
par: Dao, Trung, et autres
Publié: (2024)
Selective Visual Prompting in Vision Mamba
par: Yao, Yifeng, et autres
Publié: (2024)
par: Yao, Yifeng, et autres
Publié: (2024)
MRN: Harnessing 2D Vision Foundation Models for Diagnosing Parkinson's Disease with Limited 3D MR Data
par: Shaodong, Ding, et autres
Publié: (2025)
par: Shaodong, Ding, et autres
Publié: (2025)
Representing Topological Self-Similarity Using Fractal Feature Maps for Accurate Segmentation of Tubular Structures
par: Huang, Jiaxing, et autres
Publié: (2024)
par: Huang, Jiaxing, et autres
Publié: (2024)
Mamba-3D as Masked Autoencoders for Accurate and Data-Efficient Analysis of Medical Ultrasound Videos
par: Zhou, Jiaheng, et autres
Publié: (2025)
par: Zhou, Jiaheng, et autres
Publié: (2025)
Efficient-LVSM: Faster, Cheaper, and Better Large View Synthesis Model via Decoupled Co-Refinement Attention
par: Jia, Xiaosong, et autres
Publié: (2026)
par: Jia, Xiaosong, et autres
Publié: (2026)
PolarBEVDet: Exploring Polar Representation for Multi-View 3D Object Detection in Bird's-Eye-View
par: Yu, Zichen, et autres
Publié: (2024)
par: Yu, Zichen, et autres
Publié: (2024)
TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens
par: Yu, Ya-Qi, et autres
Publié: (2024)
par: Yu, Ya-Qi, et autres
Publié: (2024)
Point2RBox-v3: Self-Bootstrapping from Point Annotations via Integrated Pseudo-Label Refinement and Utilization
par: Zhang, Teng, et autres
Publié: (2025)
par: Zhang, Teng, et autres
Publié: (2025)
Better Eyes, Better Thoughts: Why Vision Chain-of-Thought Fails in Medicine
par: Wu, Yuan, et autres
Publié: (2026)
par: Wu, Yuan, et autres
Publié: (2026)
Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters
par: Li, Kevin Y., et autres
Publié: (2024)
par: Li, Kevin Y., et autres
Publié: (2024)
MatchSeg: Towards Better Segmentation via Reference Image Matching
par: Huo, Jiayu, et autres
Publié: (2024)
par: Huo, Jiayu, et autres
Publié: (2024)
Does Bigger Mean Better? Comparitive Analysis of CNNs and Biomedical Vision Language Modles in Medical Diagnosis
par: Tong, Ran, et autres
Publié: (2025)
par: Tong, Ran, et autres
Publié: (2025)
DiffRIS: Enhancing Referring Remote Sensing Image Segmentation with Pre-trained Text-to-Image Diffusion Models
par: Dong, Zhe, et autres
Publié: (2025)
par: Dong, Zhe, et autres
Publié: (2025)
Dolphin v1.0 Technical Report
par: Weng, Taohan, et autres
Publié: (2025)
par: Weng, Taohan, et autres
Publié: (2025)
NeuFlow v2: Push High-Efficiency Optical Flow To the Limit
par: Zhang, Zhiyong, et autres
Publié: (2024)
par: Zhang, Zhiyong, et autres
Publié: (2024)
Learning to Transform Dynamically for Better Adversarial Transferability
par: Zhu, Rongyi, et autres
Publié: (2024)
par: Zhu, Rongyi, et autres
Publié: (2024)
OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
par: Fu, Ling, et autres
Publié: (2024)
par: Fu, Ling, et autres
Publié: (2024)
Deep Neighbor Layer Aggregation for Lightweight Self-Supervised Monocular Depth Estimation
par: Boya, Wang, et autres
Publié: (2023)
par: Boya, Wang, et autres
Publié: (2023)
Disentangled Hierarchical VAE for 3D Human-Human Interaction Generation
par: Geng, Zichen, et autres
Publié: (2026)
par: Geng, Zichen, et autres
Publié: (2026)
T2I-VeRW: Part-level Fine-grained Perception for Text-to-Image Vehicle Retrieval
par: Wang, Xiao, et autres
Publié: (2026)
par: Wang, Xiao, et autres
Publié: (2026)
Compression for Better: A General and Stable Lossless Compression Framework
par: Zhang, Boyang, et autres
Publié: (2024)
par: Zhang, Boyang, et autres
Publié: (2024)
Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning
par: Ou, Siqu, et autres
Publié: (2025)
par: Ou, Siqu, et autres
Publié: (2025)
EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant
par: Wen, Zichen, et autres
Publié: (2026)
par: Wen, Zichen, et autres
Publié: (2026)
Fast Adversarial Training with Weak-to-Strong Spatial-Temporal Consistency in the Frequency Domain on Videos
par: Wang, Songping, et autres
Publié: (2025)
par: Wang, Songping, et autres
Publié: (2025)
Point2RBox-v2: Rethinking Point-supervised Oriented Object Detection with Spatial Layout Among Instances
par: Yu, Yi, et autres
Publié: (2025)
par: Yu, Yi, et autres
Publié: (2025)
Documents similaires
-
Partial Channel Network: Compute Fewer, Perform Better
par: Huang, Haiduo, et autres
Publié: (2025) -
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
par: Chen, Shimin, et autres
Publié: (2024) -
Underwater Camouflaged Object Tracking Meets Vision-Language SAM2
par: Zhang, Chunhui, et autres
Publié: (2024) -
Scaling Artificial Intelligence for Multi-Tumor Early Detection with More Reports, Fewer Masks
par: Bassi, Pedro R. A. S., et autres
Publié: (2025) -
Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning
par: Ge, Yuyao, et autres
Publié: (2025)