Animalbooth: multimodal feature enhancement for animal subject personalization
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Chen, Wu, Haitao, Wang, Kafeng, Huang, Weiran |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DisCo3D: Distilling Multi-View Consistency for 3D Scene Editing
por: Chi, Yufeng, et al.
Publicado: (2025)
por: Chi, Yufeng, et al.
Publicado: (2025)
RCR-AF: Enhancing Model Generalization via Rademacher Complexity Reduction Activation Function
por: Yu, Yunrui, et al.
Publicado: (2025)
por: Yu, Yunrui, et al.
Publicado: (2025)
PersonificationNet: Making customized subject act like a person
por: Guo, Tianchu, et al.
Publicado: (2024)
por: Guo, Tianchu, et al.
Publicado: (2024)
MIMO: A medical vision language model with visual referring multimodal input and pixel grounding multimodal output
por: Chen, Yanyuan, et al.
Publicado: (2025)
por: Chen, Yanyuan, et al.
Publicado: (2025)
Robust and Efficient Adversarial Defense in SNNs via Image Purification and Joint Detection
por: Chen, Weiran, et al.
Publicado: (2024)
por: Chen, Weiran, et al.
Publicado: (2024)
On the robustness of multimodal language model towards distractions
por: Liu, Ming, et al.
Publicado: (2025)
por: Liu, Ming, et al.
Publicado: (2025)
EZIGen: Enhancing zero-shot personalized image generation with precise subject encoding and decoupled guidance
por: Duan, Zicheng, et al.
Publicado: (2024)
por: Duan, Zicheng, et al.
Publicado: (2024)
Quasi-multimodal-based pathophysiological feature learning for retinal disease diagnosis
por: Zhang, Lu, et al.
Publicado: (2026)
por: Zhang, Lu, et al.
Publicado: (2026)
Joint-octamamba:an octa joint segmentation network based on feature enhanced mamba
por: Liu, Chuang, et al.
Publicado: (2025)
por: Liu, Chuang, et al.
Publicado: (2025)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
por: Chen, Xiuyuan, et al.
Publicado: (2023)
por: Chen, Xiuyuan, et al.
Publicado: (2023)
Bias-constrained multimodal intelligence for equitable and reliable clinical AI
por: Li, Cheng, et al.
Publicado: (2026)
por: Li, Cheng, et al.
Publicado: (2026)
OTMatch: Improving Semi-Supervised Learning with Optimal Transport
por: Tan, Zhiquan, et al.
Publicado: (2023)
por: Tan, Zhiquan, et al.
Publicado: (2023)
TransMed: Large Language Models Enhance Vision Transformer for Biomedical Image Classification
por: Zheng, Kaipeng, et al.
Publicado: (2023)
por: Zheng, Kaipeng, et al.
Publicado: (2023)
Robust feature knowledge distillation for enhanced performance of lightweight crack segmentation models
por: Chen, Zhaohui, et al.
Publicado: (2024)
por: Chen, Zhaohui, et al.
Publicado: (2024)
Buffer replay enhances the robustness of multimodal learning under missing-modality
por: Zhu, Hongye, et al.
Publicado: (2025)
por: Zhu, Hongye, et al.
Publicado: (2025)
Supervised makeup transfer with a curated dataset: Decoupling identity and makeup features for enhanced transformation
por: Pan, Qihe, et al.
Publicado: (2026)
por: Pan, Qihe, et al.
Publicado: (2026)
Scarecrow monitoring system:employing mobilenet ssd for enhanced animal supervision
por: VS, Balaji, et al.
Publicado: (2024)
por: VS, Balaji, et al.
Publicado: (2024)
SpectraFlow: Unifying Structural Pretraining and Frequency Adaptation for Medical Image Segmentation
por: Chen, Zhiquan, et al.
Publicado: (2026)
por: Chen, Zhiquan, et al.
Publicado: (2026)
Med-DisSeg: Dispersion-Driven Representation Learning for Fine-Grained Medical Image Segmentation
por: Chen, Zhiquan, et al.
Publicado: (2026)
por: Chen, Zhiquan, et al.
Publicado: (2026)
DM-FNet: Unified multimodal medical image fusion via diffusion process-trained encoder-decoder
por: He, Dan, et al.
Publicado: (2025)
por: He, Dan, et al.
Publicado: (2025)
AI-powered multimodal modeling of personalized hemodynamics in aortic stenosis
por: Ozturk, Caglar, et al.
Publicado: (2024)
por: Ozturk, Caglar, et al.
Publicado: (2024)
DA-Font: Few-Shot Font Generation via Dual-Attention Hybrid Integration
por: Chen, Weiran, et al.
Publicado: (2025)
por: Chen, Weiran, et al.
Publicado: (2025)
SHAP-CAT: A interpretable multi-modal framework enhancing WSI classification via virtual staining and shapley-value-based multimodal fusion
por: Wang, Jun, et al.
Publicado: (2024)
por: Wang, Jun, et al.
Publicado: (2024)
From Image to Video, what do we need in multimodal LLMs?
por: Huang, Suyuan, et al.
Publicado: (2024)
por: Huang, Suyuan, et al.
Publicado: (2024)
RhythmFormer: Extracting Patterned rPPG Signals based on Periodic Sparse Attention
por: Zou, Bochao, et al.
Publicado: (2024)
por: Zou, Bochao, et al.
Publicado: (2024)
Generalized Category Discovery via Reciprocal Learning and Class-Wise Distribution Regularization
por: Liu, Duo, et al.
Publicado: (2025)
por: Liu, Duo, et al.
Publicado: (2025)
Attacks on multimodal models
por: Iablochnikov, Viacheslav, et al.
Publicado: (2024)
por: Iablochnikov, Viacheslav, et al.
Publicado: (2024)
*: Improving the 3D detector by introducing Voxel2Pillar feature encoding and extracting multi-scale features
por: Li, Xusheng, et al.
Publicado: (2024)
por: Li, Xusheng, et al.
Publicado: (2024)
SAMIR, an efficient registration framework via robust feature learning from SAM
por: He, Yue, et al.
Publicado: (2025)
por: He, Yue, et al.
Publicado: (2025)
MS-Diffusion: Multi-subject Zero-shot Image Personalization with Layout Guidance
por: Wang, Xierui, et al.
Publicado: (2024)
por: Wang, Xierui, et al.
Publicado: (2024)
Information Flow in Self-Supervised Learning
por: Tan, Zhiquan, et al.
Publicado: (2023)
por: Tan, Zhiquan, et al.
Publicado: (2023)
MiVE: Multiscale Vision-language features for reference-guided video Editing
por: Wang, Tong, et al.
Publicado: (2026)
por: Wang, Tong, et al.
Publicado: (2026)
CAD-feature enhanced machine learning for manufacturing effort estimation on sheet metal bending parts
por: Ballegeer, Matteo, et al.
Publicado: (2026)
por: Ballegeer, Matteo, et al.
Publicado: (2026)
Exploring PCA-based feature representations of image pixels via CNN to enhance food image segmentation
por: Dai, Ying
Publicado: (2024)
por: Dai, Ying
Publicado: (2024)
LDRFusion: A LiDAR-Dominant multimodal refinement framework for 3D object detection
por: Wang, Jijun, et al.
Publicado: (2025)
por: Wang, Jijun, et al.
Publicado: (2025)
G-NeRF: Geometry-enhanced Novel View Synthesis from Single-View Images
por: Huang, Zixiong, et al.
Publicado: (2024)
por: Huang, Zixiong, et al.
Publicado: (2024)
MimicTalk: Mimicking a personalized and expressive 3D talking face in minutes
por: Ye, Zhenhui, et al.
Publicado: (2024)
por: Ye, Zhenhui, et al.
Publicado: (2024)
MedGEN-Bench: Contextually entangled benchmark for open-ended multimodal medical generation
por: Yang, Junjie, et al.
Publicado: (2025)
por: Yang, Junjie, et al.
Publicado: (2025)
A multimodal vision foundation model for generalizable knee pathology
por: Yu, Kang, et al.
Publicado: (2026)
por: Yu, Kang, et al.
Publicado: (2026)
Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR
por: Hu, Ruina, et al.
Publicado: (2026)
por: Hu, Ruina, et al.
Publicado: (2026)
Ejemplares similares
-
DisCo3D: Distilling Multi-View Consistency for 3D Scene Editing
por: Chi, Yufeng, et al.
Publicado: (2025) -
RCR-AF: Enhancing Model Generalization via Rademacher Complexity Reduction Activation Function
por: Yu, Yunrui, et al.
Publicado: (2025) -
PersonificationNet: Making customized subject act like a person
por: Guo, Tianchu, et al.
Publicado: (2024) -
MIMO: A medical vision language model with visual referring multimodal input and pixel grounding multimodal output
por: Chen, Yanyuan, et al.
Publicado: (2025) -
Robust and Efficient Adversarial Defense in SNNs via Image Purification and Joint Detection
por: Chen, Weiran, et al.
Publicado: (2024)