Not just Birds and Cars: Generic, Scalable and Explainable Models for Professional Visual Recognition
Fuente:
arXiv
Saved in:
| Main Authors: | Wu, Junde, Zhu, Jiayuan, Xu, Min, Jin, Yueming |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
One-Prompt to Segment All Medical Images
by: Wu, Junde, et al.
Published: (2023)
by: Wu, Junde, et al.
Published: (2023)
Medical SAM 2: Segment medical images as video via Segment Anything Model 2
by: Zhu, Jiayuan, et al.
Published: (2024)
by: Zhu, Jiayuan, et al.
Published: (2024)
MGI: Multimodal Contrastive pre-training of Genomic and Medical Imaging
by: Zhou, Jiaying, et al.
Published: (2024)
by: Zhou, Jiaying, et al.
Published: (2024)
MedUHIP: Towards Human-In-the-Loop Medical Segmentation
by: Zhu, Jiayuan, et al.
Published: (2024)
by: Zhu, Jiayuan, et al.
Published: (2024)
Medical SAM Adapter: Adapting Segment Anything Model for Medical Image Segmentation
by: Wu, Junde, et al.
Published: (2023)
by: Wu, Junde, et al.
Published: (2023)
Medical Graph RAG: Towards Safe Medical Large Language Model via Graph Retrieval-Augmented Generation
by: Wu, Junde, et al.
Published: (2024)
by: Wu, Junde, et al.
Published: (2024)
MedVAR: Towards Scalable and Efficient Medical Image Generation via Next-scale Autoregressive Prediction
by: He, Zhicheng, et al.
Published: (2026)
by: He, Zhicheng, et al.
Published: (2026)
Towards Collective Intelligence: Uncertainty-aware SAM Adaptation for Ambiguous Medical Image Segmentation
by: Jiang, Mingzhou, et al.
Published: (2024)
by: Jiang, Mingzhou, et al.
Published: (2024)
MedOpenClaw and MedFlowBench: Auditing Medical Agents in Full-Study Workflows
by: Shen, Weixiang, et al.
Published: (2026)
by: Shen, Weixiang, et al.
Published: (2026)
Scalable Object Detection in the Car Interior With Vision Foundation Models
by: Schmidt, Sebastian, et al.
Published: (2025)
by: Schmidt, Sebastian, et al.
Published: (2025)
SPA: Efficient User-Preference Alignment against Uncertainty in Medical Image Segmentation
by: Zhu, Jiayuan, et al.
Published: (2024)
by: Zhu, Jiayuan, et al.
Published: (2024)
in-Car Biometrics (iCarB) Datasets for Driver Recognition: Face, Fingerprint, and Voice
by: Hahn, Vedrana Krivokuca, et al.
Published: (2024)
by: Hahn, Vedrana Krivokuca, et al.
Published: (2024)
Surgical SAM 2: Real-time Segment Anything in Surgical Video by Efficient Frame Pruning
by: Liu, Haofeng, et al.
Published: (2024)
by: Liu, Haofeng, et al.
Published: (2024)
DreamCar: Leveraging Car-specific Prior for in-the-wild 3D Car Reconstruction
by: Du, Xiaobiao, et al.
Published: (2024)
by: Du, Xiaobiao, et al.
Published: (2024)
Car-GS: Addressing Reflective and Transparent Surface Challenges in 3D Car Reconstruction
by: Li, Congcong, et al.
Published: (2025)
by: Li, Congcong, et al.
Published: (2025)
Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor
by: Chen, Jiali, et al.
Published: (2024)
by: Chen, Jiali, et al.
Published: (2024)
Visual WetlandBirds Dataset: Bird Species Identification and Behavior Recognition in Videos
by: Rodriguez-Juan, Javier, et al.
Published: (2025)
by: Rodriguez-Juan, Javier, et al.
Published: (2025)
From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding
by: Liu, Yuyuan, et al.
Published: (2026)
by: Liu, Yuyuan, et al.
Published: (2026)
Range and Bird's Eye View Fused Cross-Modal Visual Place Recognition
by: Peng, Jianyi, et al.
Published: (2025)
by: Peng, Jianyi, et al.
Published: (2025)
3DRealCar: An In-the-wild RGB-D Car Dataset with 360-degree Views
by: Du, Xiaobiao, et al.
Published: (2024)
by: Du, Xiaobiao, et al.
Published: (2024)
An Effective End-to-End Solution for Multimodal Action Recognition
by: Wang, Songping, et al.
Published: (2025)
by: Wang, Songping, et al.
Published: (2025)
Structure Matters: Revisiting Boundary Refinement in Video Object Segmentation
by: Qin, Guanyi, et al.
Published: (2025)
by: Qin, Guanyi, et al.
Published: (2025)
Infrared Adversarial Car Stickers
by: Zhu, Xiaopei, et al.
Published: (2024)
by: Zhu, Xiaopei, et al.
Published: (2024)
MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning
by: Pan, Jiazhen, et al.
Published: (2025)
by: Pan, Jiazhen, et al.
Published: (2025)
3DMedAgent: Unified Perception-to-Understanding for 3D Medical Analysis
by: Wang, Ziyue, et al.
Published: (2026)
by: Wang, Ziyue, et al.
Published: (2026)
ReSurgSAM2: Referring Segment Anything in Surgical Video via Credible Long-term Tracking
by: Liu, Haofeng, et al.
Published: (2025)
by: Liu, Haofeng, et al.
Published: (2025)
From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation
by: Li, Bohan, et al.
Published: (2026)
by: Li, Bohan, et al.
Published: (2026)
Improving Visual Recognition with Hyperbolical Visual Hierarchy Mapping
by: Kwon, Hyeongjun, et al.
Published: (2024)
by: Kwon, Hyeongjun, et al.
Published: (2024)
ToolTipNet: A Segmentation-Driven Deep Learning Baseline for Surgical Instrument Tip Detection
by: Wu, Zijian, et al.
Published: (2025)
by: Wu, Zijian, et al.
Published: (2025)
DiffusionAgent: Navigating Expert Models for Agentic Image Generation
by: Qin, Jie, et al.
Published: (2024)
by: Qin, Jie, et al.
Published: (2024)
Semi-Supervised Learning for Visual Bird's Eye View Semantic Segmentation
by: Zhu, Junyu, et al.
Published: (2023)
by: Zhu, Junyu, et al.
Published: (2023)
T2Vs Meet VLMs: A Scalable Multimodal Dataset for Visual Harmfulness Recognition
by: Yeh, Chen, et al.
Published: (2024)
by: Yeh, Chen, et al.
Published: (2024)
TCFormer: Visual Recognition via Token Clustering Transformer
by: Zeng, Wang, et al.
Published: (2024)
by: Zeng, Wang, et al.
Published: (2024)
SoftHGNN: Soft Hypergraph Neural Networks for General Visual Recognition
by: Lei, Mengqi, et al.
Published: (2025)
by: Lei, Mengqi, et al.
Published: (2025)
Towards Scalable Pre-training of Visual Tokenizers for Generation
by: Yao, Jingfeng, et al.
Published: (2025)
by: Yao, Jingfeng, et al.
Published: (2025)
Exploiting Polarized Material Cues for Robust Car Detection
by: Dong, Wen, et al.
Published: (2024)
by: Dong, Wen, et al.
Published: (2024)
Car-1000: A New Large Scale Fine-Grained Visual Categorization Dataset
by: Hu, Yutao, et al.
Published: (2025)
by: Hu, Yutao, et al.
Published: (2025)
CONDA: Continual Unsupervised Domain Adaptation Learning in Visual Perception for Self-Driving Cars
by: Truong, Thanh-Dat, et al.
Published: (2022)
by: Truong, Thanh-Dat, et al.
Published: (2022)
DTL: Disentangled Transfer Learning for Visual Recognition
by: Fu, Minghao, et al.
Published: (2023)
by: Fu, Minghao, et al.
Published: (2023)
Grounding Language Models for Visual Entity Recognition
by: Xiao, Zilin, et al.
Published: (2024)
by: Xiao, Zilin, et al.
Published: (2024)
Similar Items
-
One-Prompt to Segment All Medical Images
by: Wu, Junde, et al.
Published: (2023) -
Medical SAM 2: Segment medical images as video via Segment Anything Model 2
by: Zhu, Jiayuan, et al.
Published: (2024) -
MGI: Multimodal Contrastive pre-training of Genomic and Medical Imaging
by: Zhou, Jiaying, et al.
Published: (2024) -
MedUHIP: Towards Human-In-the-Loop Medical Segmentation
by: Zhu, Jiayuan, et al.
Published: (2024) -
Medical SAM Adapter: Adapting Segment Anything Model for Medical Image Segmentation
by: Wu, Junde, et al.
Published: (2023)