Few-shot crack image classification using clip based on bayesian optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Yingchao, Liu, Cheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HuMoCon: Concept Discovery for Human Motion Understanding
di: Fang, Qihang, et al.
Pubblicazione: (2025)
di: Fang, Qihang, et al.
Pubblicazione: (2025)
Fixed-Budget Parameter-Efficient Training with Frozen Encoders Improves Multimodal Chest X-Ray Classification
di: Khan, Md Ashik, et al.
Pubblicazione: (2025)
di: Khan, Md Ashik, et al.
Pubblicazione: (2025)
A Multimodal Pipeline for Clinical Data Extraction: Applying Vision-Language Models to Scans of Transfusion Reaction Reports
di: Schäfer, Henning, et al.
Pubblicazione: (2025)
di: Schäfer, Henning, et al.
Pubblicazione: (2025)
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
di: Tu, Songjun, et al.
Pubblicazione: (2025)
di: Tu, Songjun, et al.
Pubblicazione: (2025)
Unlocking UML Class Diagram Understanding in Vision Language Models
di: Naboichenko, Artem, et al.
Pubblicazione: (2026)
di: Naboichenko, Artem, et al.
Pubblicazione: (2026)
Continuous Latent Diffusion Language Model
di: Guo, Hongcan, et al.
Pubblicazione: (2026)
di: Guo, Hongcan, et al.
Pubblicazione: (2026)
Optimized Gradient Clipping for Noisy Label Learning
di: Ye, Xichen, et al.
Pubblicazione: (2024)
di: Ye, Xichen, et al.
Pubblicazione: (2024)
WSI-Agents: A Collaborative Multi-Agent System for Multi-Modal Whole Slide Image Analysis
di: Lyu, Xinheng, et al.
Pubblicazione: (2025)
di: Lyu, Xinheng, et al.
Pubblicazione: (2025)
Exploring the Capabilities of Large Language Model Encoders for Image-Text Retrieval in Chest X-rays
di: Ko, Hanbin, et al.
Pubblicazione: (2025)
di: Ko, Hanbin, et al.
Pubblicazione: (2025)
OR-VSKC: Resolving Visual-Semantic Knowledge Conflicts in Operating Rooms with Synthetic Data-Guided Alignment
di: Zhao, Weiyi, et al.
Pubblicazione: (2025)
di: Zhao, Weiyi, et al.
Pubblicazione: (2025)
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images
di: Koukounas, Andreas, et al.
Pubblicazione: (2024)
di: Koukounas, Andreas, et al.
Pubblicazione: (2024)
Leveraging large multimodal models for audio-video deepfake detection: a pilot study
di: Cao, Songjun, et al.
Pubblicazione: (2026)
di: Cao, Songjun, et al.
Pubblicazione: (2026)
Logistic Regression makes small LLMs strong and explainable "tens-of-shot" classifiers
di: Buckmann, Marcus, et al.
Pubblicazione: (2024)
di: Buckmann, Marcus, et al.
Pubblicazione: (2024)
Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark
di: Cheng, Ziming, et al.
Pubblicazione: (2025)
di: Cheng, Ziming, et al.
Pubblicazione: (2025)
Does CLIP perceive art the same way we do?
di: Asperti, Andrea, et al.
Pubblicazione: (2025)
di: Asperti, Andrea, et al.
Pubblicazione: (2025)
Grounded Gesture Generation: Language, Motion, and Space
di: Deichler, Anna, et al.
Pubblicazione: (2025)
di: Deichler, Anna, et al.
Pubblicazione: (2025)
Pattern Recognition Tasks with Personalized Federated Learning
di: Rahman, Md. Arifur, et al.
Pubblicazione: (2026)
di: Rahman, Md. Arifur, et al.
Pubblicazione: (2026)
The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark
di: Liu, Hao, et al.
Pubblicazione: (2026)
di: Liu, Hao, et al.
Pubblicazione: (2026)
VideoHEDGE: Entropy-Based Hallucination Detection for Video-VLMs via Semantic Clustering and Spatiotemporal Perturbations
di: Gautam, Sushant, et al.
Pubblicazione: (2026)
di: Gautam, Sushant, et al.
Pubblicazione: (2026)
Advancing Expert Specialization for Better MoE
di: Guo, Hongcan, et al.
Pubblicazione: (2025)
di: Guo, Hongcan, et al.
Pubblicazione: (2025)
Extreme Precipitation Nowcasting using Multi-Task Latent Diffusion Models
di: Chaorong, Li, et al.
Pubblicazione: (2024)
di: Chaorong, Li, et al.
Pubblicazione: (2024)
Synthetic CT image generation from CBCT: A Systematic Review
di: Altalib, Alzahra, et al.
Pubblicazione: (2025)
di: Altalib, Alzahra, et al.
Pubblicazione: (2025)
CLMN: Concept based Language Models via Neural Symbolic Reasoning
di: Yang, Yibo
Pubblicazione: (2025)
di: Yang, Yibo
Pubblicazione: (2025)
Explainable Image Captioning using CNN- CNN architecture and Hierarchical Attention
di: Mohan, Rishi Kesav, et al.
Pubblicazione: (2024)
di: Mohan, Rishi Kesav, et al.
Pubblicazione: (2024)
PerkwE_COQA: Enhanced Persian Conversational Question Answering by combining contextual keyword extraction with Large Language Models
di: Moradbeiki, Pardis, et al.
Pubblicazione: (2024)
di: Moradbeiki, Pardis, et al.
Pubblicazione: (2024)
ReFACT: Updating Text-to-Image Models by Editing the Text Encoder
di: Arad, Dana, et al.
Pubblicazione: (2023)
di: Arad, Dana, et al.
Pubblicazione: (2023)
Application of deep learning approaches for medieval historical documents transcription
di: Voloshchuk, Maksym, et al.
Pubblicazione: (2025)
di: Voloshchuk, Maksym, et al.
Pubblicazione: (2025)
Banana Ripeness Level Classification using a Simple CNN Model Trained with Real and Synthetic Datasets
di: Chuquimarca, Luis, et al.
Pubblicazione: (2025)
di: Chuquimarca, Luis, et al.
Pubblicazione: (2025)
Hateful Meme Detection through Context-Sensitive Prompting and Fine-Grained Labeling
di: Ouyang, Rongxin, et al.
Pubblicazione: (2024)
di: Ouyang, Rongxin, et al.
Pubblicazione: (2024)
Persona-aware and Explainable Bikeability Assessment: A Vision-Language Model Approach
di: Dai, Yilong, et al.
Pubblicazione: (2026)
di: Dai, Yilong, et al.
Pubblicazione: (2026)
VGA: Vision GUI Assistant -- Minimizing Hallucinations through Image-Centric Fine-Tuning
di: Meng, Ziyang, et al.
Pubblicazione: (2024)
di: Meng, Ziyang, et al.
Pubblicazione: (2024)
Cache-to-Cache: Direct Semantic Communication Between Large Language Models
di: Fu, Tianyu, et al.
Pubblicazione: (2025)
di: Fu, Tianyu, et al.
Pubblicazione: (2025)
Dual-sensing driving detection model
di: K, Leon C. C., et al.
Pubblicazione: (2025)
di: K, Leon C. C., et al.
Pubblicazione: (2025)
Research on a hybrid LSTM-CNN-Attention model for text-based web content classification
di: Kuz, Mykola, et al.
Pubblicazione: (2025)
di: Kuz, Mykola, et al.
Pubblicazione: (2025)
SwiftDossier: Tailored Automatic Dossier for Drug Discovery with LLMs and Agents
di: Fossi, Gabriele, et al.
Pubblicazione: (2024)
di: Fossi, Gabriele, et al.
Pubblicazione: (2024)
Biomedical Visual Instruction Tuning with Clinician Preference Alignment
di: Cui, Hejie, et al.
Pubblicazione: (2024)
di: Cui, Hejie, et al.
Pubblicazione: (2024)
Embedding Compression via Spherical Coordinates
di: Xiao, Han
Pubblicazione: (2026)
di: Xiao, Han
Pubblicazione: (2026)
The SAGES Critical View of Safety Challenge: A Global Benchmark for AI-Assisted Surgical Quality Assessment
di: Alapatt, Deepak, et al.
Pubblicazione: (2025)
di: Alapatt, Deepak, et al.
Pubblicazione: (2025)
A Survey on Vision-Language-Action Models for Embodied AI
di: Ma, Yueen, et al.
Pubblicazione: (2024)
di: Ma, Yueen, et al.
Pubblicazione: (2024)
Investigating Neuron Ablation in Attention Heads: The Case for Peak Activation Centering
di: Pochinkov, Nicholas, et al.
Pubblicazione: (2024)
di: Pochinkov, Nicholas, et al.
Pubblicazione: (2024)
Documenti analoghi
-
HuMoCon: Concept Discovery for Human Motion Understanding
di: Fang, Qihang, et al.
Pubblicazione: (2025) -
Fixed-Budget Parameter-Efficient Training with Frozen Encoders Improves Multimodal Chest X-Ray Classification
di: Khan, Md Ashik, et al.
Pubblicazione: (2025) -
A Multimodal Pipeline for Clinical Data Extraction: Applying Vision-Language Models to Scans of Transfusion Reaction Reports
di: Schäfer, Henning, et al.
Pubblicazione: (2025) -
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
di: Tu, Songjun, et al.
Pubblicazione: (2025) -
Unlocking UML Class Diagram Understanding in Vision Language Models
di: Naboichenko, Artem, et al.
Pubblicazione: (2026)