Evaluating Large and Lightweight Vision Models for Irregular Component Segmentation in E-Waste Disassembly
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Xinyao, Liu, Chang, Liang, Xiao, Zheng, Minghui, Behdad, Sara |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
por: Shourya, Aditya, et al.
Publicado: (2025)
por: Shourya, Aditya, et al.
Publicado: (2025)
Vision-Language Model for Object Detection and Segmentation: A Review and Evaluation
por: Feng, Yongchao, et al.
Publicado: (2025)
por: Feng, Yongchao, et al.
Publicado: (2025)
LIDAR: Lightweight Adaptive Cue-Aware Fusion Vision Mamba for Multimodal Segmentation of Structural Cracks
por: Liu, Hui, et al.
Publicado: (2025)
por: Liu, Hui, et al.
Publicado: (2025)
Efficient Training of Large Vision Models via Advanced Automated Progressive Learning
por: Li, Changlin, et al.
Publicado: (2024)
por: Li, Changlin, et al.
Publicado: (2024)
Measuring the Measurers: Quality Evaluation of Hallucination Benchmarks for Large Vision-Language Models
por: Yan, Bei, et al.
Publicado: (2024)
por: Yan, Bei, et al.
Publicado: (2024)
DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models
por: Shi, Xinrui, et al.
Publicado: (2026)
por: Shi, Xinrui, et al.
Publicado: (2026)
TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens
por: Yu, Ya-Qi, et al.
Publicado: (2024)
por: Yu, Ya-Qi, et al.
Publicado: (2024)
Early Explorations of Lightweight Models for Wound Segmentation on Mobile Devices
por: Borst, Vanessa, et al.
Publicado: (2024)
por: Borst, Vanessa, et al.
Publicado: (2024)
EfficientCrackNet: A Lightweight Model for Crack Segmentation
por: Zim, Abid Hasan, et al.
Publicado: (2024)
por: Zim, Abid Hasan, et al.
Publicado: (2024)
MM-ISTS: Cooperating Irregularly Sampled Time Series Forecasting with Multimodal Vision-Text LLMs
por: Lei, Zhi, et al.
Publicado: (2026)
por: Lei, Zhi, et al.
Publicado: (2026)
MobileUNETR: A Lightweight End-To-End Hybrid Vision Transformer For Efficient Medical Image Segmentation
por: Perera, Shehan, et al.
Publicado: (2024)
por: Perera, Shehan, et al.
Publicado: (2024)
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
por: Wang, Sibo, et al.
Publicado: (2024)
por: Wang, Sibo, et al.
Publicado: (2024)
MedHEval: Benchmarking Hallucinations and Mitigation Strategies in Medical Large Vision-Language Models
por: Chang, Aofei, et al.
Publicado: (2025)
por: Chang, Aofei, et al.
Publicado: (2025)
B-AVIBench: Towards Evaluating the Robustness of Large Vision-Language Model on Black-box Adversarial Visual-Instructions
por: Zhang, Hao, et al.
Publicado: (2024)
por: Zhang, Hao, et al.
Publicado: (2024)
MedLiteNet: Lightweight Hybrid Medical Image Segmentation Model
por: Yu, Pengyang, et al.
Publicado: (2025)
por: Yu, Pengyang, et al.
Publicado: (2025)
Review of Hallucination Understanding in Large Language and Vision Models
por: Ho, Zhengyi, et al.
Publicado: (2025)
por: Ho, Zhengyi, et al.
Publicado: (2025)
VLA-LPAF: Lightweight Perspective-Adaptive Fusion for Vision-Language-Action to Enable More Unconstrained Robotic Manipulation
por: Bian, Jinyue, et al.
Publicado: (2025)
por: Bian, Jinyue, et al.
Publicado: (2025)
VHELM: A Holistic Evaluation of Vision Language Models
por: Lee, Tony, et al.
Publicado: (2024)
por: Lee, Tony, et al.
Publicado: (2024)
Enhancing Medical Large Vision-Language Models via Alignment Distillation
por: Chang, Aofei, et al.
Publicado: (2025)
por: Chang, Aofei, et al.
Publicado: (2025)
Enabling Real-Time Colonoscopic Polyp Segmentation on Commodity CPUs via Ultra-Lightweight Architecture
por: Gao, Weihao, et al.
Publicado: (2026)
por: Gao, Weihao, et al.
Publicado: (2026)
Probing Visual Concepts in Lightweight Vision-Language Models for Automated Driving
por: Theodoridis, Nikos, et al.
Publicado: (2026)
por: Theodoridis, Nikos, et al.
Publicado: (2026)
Evaluating Large Vision-language Models for Surgical Tool Detection
por: Poudel, Nakul, et al.
Publicado: (2026)
por: Poudel, Nakul, et al.
Publicado: (2026)
Integrating Sequence and Image Modeling in Irregular Medical Time Series Through Self-Supervised Learning
por: Chen, Liuqing, et al.
Publicado: (2025)
por: Chen, Liuqing, et al.
Publicado: (2025)
MedVH: Towards Systematic Evaluation of Hallucination for Large Vision Language Models in the Medical Context
por: Gu, Zishan, et al.
Publicado: (2024)
por: Gu, Zishan, et al.
Publicado: (2024)
How Lightweight Can A Vision Transformer Be
por: Tan, Jen Hong
Publicado: (2024)
por: Tan, Jen Hong
Publicado: (2024)
An archaeological Catalog Collection Method Based on Large Vision-Language Models
por: Pang, Honglin, et al.
Publicado: (2024)
por: Pang, Honglin, et al.
Publicado: (2024)
Arbitrary Data as Images: Fusion of Patient Data Across Modalities and Irregular Intervals with Vision Transformers
por: Tölle, Malte, et al.
Publicado: (2025)
por: Tölle, Malte, et al.
Publicado: (2025)
Agglomerating Large Vision Encoders via Distillation for VFSS Segmentation
por: Zeng, Chengxi, et al.
Publicado: (2025)
por: Zeng, Chengxi, et al.
Publicado: (2025)
Systematic Evaluation of Large Vision-Language Models for Surgical Artificial Intelligence
por: Rau, Anita, et al.
Publicado: (2025)
por: Rau, Anita, et al.
Publicado: (2025)
Towards a Systematic Evaluation of Hallucinations in Large-Vision Language Models
por: Seth, Ashish, et al.
Publicado: (2024)
por: Seth, Ashish, et al.
Publicado: (2024)
FlowLearn: Evaluating Large Vision-Language Models on Flowchart Understanding
por: Pan, Huitong, et al.
Publicado: (2024)
por: Pan, Huitong, et al.
Publicado: (2024)
An Ensemble Learning Approach towards Waste Segmentation in Cluttered Environment
por: Jafar, Maimoona, et al.
Publicado: (2026)
por: Jafar, Maimoona, et al.
Publicado: (2026)
Customize Segment Anything Model for Multi-Modal Semantic Segmentation with Mixture of LoRA Experts
por: Zhu, Chenyang, et al.
Publicado: (2024)
por: Zhu, Chenyang, et al.
Publicado: (2024)
Efficient Prompt Tuning of Large Vision-Language Model for Fine-Grained Ship Classification
por: Lan, Long, et al.
Publicado: (2024)
por: Lan, Long, et al.
Publicado: (2024)
MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning
por: Liu, Yi, et al.
Publicado: (2025)
por: Liu, Yi, et al.
Publicado: (2025)
TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models
por: Yu, Ya-Qi, et al.
Publicado: (2024)
por: Yu, Ya-Qi, et al.
Publicado: (2024)
Surgical-LLaVA: Toward Surgical Scenario Understanding via Large Language and Vision Models
por: Jin, Juseong, et al.
Publicado: (2024)
por: Jin, Juseong, et al.
Publicado: (2024)
Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration
por: Zhu, Younan, et al.
Publicado: (2025)
por: Zhu, Younan, et al.
Publicado: (2025)
Assessing Color Vision Test in Large Vision-language Models
por: Ye, Hongfei, et al.
Publicado: (2025)
por: Ye, Hongfei, et al.
Publicado: (2025)
Trustworthy Large Models in Vision: A Survey
por: Guo, Ziyan, et al.
Publicado: (2023)
por: Guo, Ziyan, et al.
Publicado: (2023)
Ejemplares similares
-
Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
por: Shourya, Aditya, et al.
Publicado: (2025) -
Vision-Language Model for Object Detection and Segmentation: A Review and Evaluation
por: Feng, Yongchao, et al.
Publicado: (2025) -
LIDAR: Lightweight Adaptive Cue-Aware Fusion Vision Mamba for Multimodal Segmentation of Structural Cracks
por: Liu, Hui, et al.
Publicado: (2025) -
Efficient Training of Large Vision Models via Advanced Automated Progressive Learning
por: Li, Changlin, et al.
Publicado: (2024) -
Measuring the Measurers: Quality Evaluation of Hallucination Benchmarks for Large Vision-Language Models
por: Yan, Bei, et al.
Publicado: (2024)