Enregistré dans:
| Auteurs principaux: | Chen, Huilin, Sun, Qiyu, Li, Fangfei, Tang, Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2407.06513 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Applying Deep Neural Networks to automate visual verification of manual bracket installations in aerospace
par: Oyekan, John, et autres
Publié: (2024)
par: Oyekan, John, et autres
Publié: (2024)
Thinker: A vision-language foundation model for embodied intelligence
par: Pan, Baiyu, et autres
Publié: (2026)
par: Pan, Baiyu, et autres
Publié: (2026)
Robust Single-shot Structured Light 3D Imaging via Neural Feature Decoding
par: Li, Jiaheng, et autres
Publié: (2025)
par: Li, Jiaheng, et autres
Publié: (2025)
ProFound: A moderate-sized vision foundation model for multi-task prostate imaging
par: Wang, Yipei, et autres
Publié: (2026)
par: Wang, Yipei, et autres
Publié: (2026)
Adversarial Examples in Environment Perception for Automated Driving (Review)
par: Yan, Jun, et autres
Publié: (2025)
par: Yan, Jun, et autres
Publié: (2025)
UniPINN: A Unified PINN Framework for Multi-task Learning of Diverse Navier-Stokes Equations
par: Sun, Dengdi, et autres
Publié: (2026)
par: Sun, Dengdi, et autres
Publié: (2026)
HSFusion: A high-level vision task-driven infrared and visible image fusion network via semantic and geometric domain transformation
par: Jiang, Chengjie, et autres
Publié: (2024)
par: Jiang, Chengjie, et autres
Publié: (2024)
Utilizing the Mean Teacher with Supcontrast Loss for Wafer Pattern Recognition
par: Wei, Qiyu, et autres
Publié: (2024)
par: Wei, Qiyu, et autres
Publié: (2024)
Computer vision-based estimation of invertebrate biomass
par: Impiö, Mikko, et autres
Publié: (2026)
par: Impiö, Mikko, et autres
Publié: (2026)
ViSTa Dataset: Do vision-language models understand sequential tasks?
par: Wybitul, Evžen, et autres
Publié: (2024)
par: Wybitul, Evžen, et autres
Publié: (2024)
Representation geometry shapes task performance in vision-language modeling for CT enterography
par: Minoccheri, Cristian, et autres
Publié: (2026)
par: Minoccheri, Cristian, et autres
Publié: (2026)
Adaptive Dual-Constrained Line Aggregation for Robust Generic and Wireframe Line Segment Detection
par: Liu, Chenguang, et autres
Publié: (2025)
par: Liu, Chenguang, et autres
Publié: (2025)
A Unified Anomaly Synthesis Strategy with Gradient Ascent for Industrial Anomaly Detection and Localization
par: Chen, Qiyu, et autres
Publié: (2024)
par: Chen, Qiyu, et autres
Publié: (2024)
RoMa: Robust Dense Feature Matching
par: Edstedt, Johan, et autres
Publié: (2023)
par: Edstedt, Johan, et autres
Publié: (2023)
Bridging Cross-task Protocol Inconsistency for Distillation in Dense Object Detection
par: Yang, Longrong, et autres
Publié: (2023)
par: Yang, Longrong, et autres
Publié: (2023)
Openfly: A comprehensive platform for aerial vision-language navigation
par: Gao, Yunpeng, et autres
Publié: (2025)
par: Gao, Yunpeng, et autres
Publié: (2025)
Fine-tuning vision foundation model for crack segmentation in civil infrastructures
par: Ge, Kang, et autres
Publié: (2023)
par: Ge, Kang, et autres
Publié: (2023)
Beyond conventional vision: RGB-event fusion for robust object detection in dynamic traffic scenarios
par: Liu, Zhanwen, et autres
Publié: (2025)
par: Liu, Zhanwen, et autres
Publié: (2025)
Learning Physical Dynamics for Object-centric Visual Prediction
par: Xu, Huilin, et autres
Publié: (2024)
par: Xu, Huilin, et autres
Publié: (2024)
Bias-constrained multimodal intelligence for equitable and reliable clinical AI
par: Li, Cheng, et autres
Publié: (2026)
par: Li, Cheng, et autres
Publié: (2026)
VMAD: Visual-enhanced Multimodal Large Language Model for Zero-Shot Anomaly Detection
par: Deng, Huilin, et autres
Publié: (2024)
par: Deng, Huilin, et autres
Publié: (2024)
TABLET: Table Structure Recognition using Encoder-only Transformers
par: Hou, Qiyu, et autres
Publié: (2025)
par: Hou, Qiyu, et autres
Publié: (2025)
MRAD: Zero-Shot Anomaly Detection with Memory-Driven Retrieval
par: Xu, Chaoran, et autres
Publié: (2026)
par: Xu, Chaoran, et autres
Publié: (2026)
POPCat: Propagation of particles for complex annotation tasks
par: Yang, Adam Srebrnjak, et autres
Publié: (2024)
par: Yang, Adam Srebrnjak, et autres
Publié: (2024)
OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control
par: Wang, Yukun, et autres
Publié: (2026)
par: Wang, Yukun, et autres
Publié: (2026)
Concurrent validity of computer-vision artificial intelligence player tracking software using broadcast footage
par: Crang, Zachary L., et autres
Publié: (2025)
par: Crang, Zachary L., et autres
Publié: (2025)
Dynamic Proxy Domain Generalizes the Crowd Localization by Better Binary Segmentation
par: Gao, Junyu, et autres
Publié: (2024)
par: Gao, Junyu, et autres
Publié: (2024)
SOTA: Self-adaptive Optimal Transport for Zero-Shot Classification with Multiple Foundation Models
par: Hu, Zhanxuan, et autres
Publié: (2025)
par: Hu, Zhanxuan, et autres
Publié: (2025)
DSPNet: Dual-vision Scene Perception for Robust 3D Question Answering
par: Luo, Jingzhou, et autres
Publié: (2025)
par: Luo, Jingzhou, et autres
Publié: (2025)
4D-Rotor Gaussian Splatting: Towards Efficient Novel View Synthesis for Dynamic Scenes
par: Duan, Yuanxing, et autres
Publié: (2024)
par: Duan, Yuanxing, et autres
Publié: (2024)
MT-Depth: Multi-task Instance feature analysis for the Depth Completion
par: Nizamani, Abdul Haseeb, et autres
Publié: (2025)
par: Nizamani, Abdul Haseeb, et autres
Publié: (2025)
Efficient RGB-D Scene Understanding via Multi-task Adaptive Learning and Cross-dimensional Feature Guidance
par: Sun, Guodong, et autres
Publié: (2026)
par: Sun, Guodong, et autres
Publié: (2026)
Flatten: Video Action Recognition is an Image Classification task
par: Chen, Junlin, et autres
Publié: (2024)
par: Chen, Junlin, et autres
Publié: (2024)
WS-DETR: Robust Water Surface Object Detection through Vision-Radar Fusion with Detection Transformer
par: Yin, Huilin, et autres
Publié: (2025)
par: Yin, Huilin, et autres
Publié: (2025)
LiMT: A Multi-task Liver Image Benchmark Dataset
par: Liu, Zhe, et autres
Publié: (2025)
par: Liu, Zhe, et autres
Publié: (2025)
SGIA: Enhancing Fine-Grained Visual Classification with Sequence Generative Image Augmentation
par: Liao, Qiyu, et autres
Publié: (2024)
par: Liao, Qiyu, et autres
Publié: (2024)
Co-Training Vision Language Models for Remote Sensing Multi-task Learning
par: Li, Qingyun, et autres
Publié: (2025)
par: Li, Qingyun, et autres
Publié: (2025)
Joint Fusion and Encoding: Advancing Multimodal Retrieval from the Ground Up
par: Huang, Lang, et autres
Publié: (2025)
par: Huang, Lang, et autres
Publié: (2025)
RefracGS: Novel View Synthesis Through Refractive Water Surfaces with 3D Gaussian Ray Tracing
par: Shao, Yiming, et autres
Publié: (2026)
par: Shao, Yiming, et autres
Publié: (2026)
OccScene: Semantic Occupancy-based Cross-task Mutual Learning for 3D Scene Generation
par: Li, Bohan, et autres
Publié: (2024)
par: Li, Bohan, et autres
Publié: (2024)
Documents similaires
-
Applying Deep Neural Networks to automate visual verification of manual bracket installations in aerospace
par: Oyekan, John, et autres
Publié: (2024) -
Thinker: A vision-language foundation model for embodied intelligence
par: Pan, Baiyu, et autres
Publié: (2026) -
Robust Single-shot Structured Light 3D Imaging via Neural Feature Decoding
par: Li, Jiaheng, et autres
Publié: (2025) -
ProFound: A moderate-sized vision foundation model for multi-task prostate imaging
par: Wang, Yipei, et autres
Publié: (2026) -
Adversarial Examples in Environment Perception for Automated Driving (Review)
par: Yan, Jun, et autres
Publié: (2025)