Salvato in:
| Autori principali: | Wu, Yi-Fu, Lee, Minseung, Ahn, Sungjin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2402.01203 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Dreamweaver: Learning Compositional World Models from Pixels
di: Baek, Junyeob, et al.
Pubblicazione: (2025)
di: Baek, Junyeob, et al.
Pubblicazione: (2025)
An Investigation into Pre-Training Object-Centric Representations for Reinforcement Learning
di: Yoon, Jaesik, et al.
Pubblicazione: (2023)
di: Yoon, Jaesik, et al.
Pubblicazione: (2023)
Learning to Compose: Improving Object Centric Learning by Injecting Compositionality
di: Jung, Whie, et al.
Pubblicazione: (2024)
di: Jung, Whie, et al.
Pubblicazione: (2024)
Concept Pinpoint Eraser for Text-to-image Diffusion Models via Residual Attention Gate
di: Lee, Byung Hyun, et al.
Pubblicazione: (2025)
di: Lee, Byung Hyun, et al.
Pubblicazione: (2025)
Parallelized Spatiotemporal Binding
di: Singh, Gautam, et al.
Pubblicazione: (2024)
di: Singh, Gautam, et al.
Pubblicazione: (2024)
Multimodal Transformer With a Low-Computational-Cost Guarantee
di: Park, Sungjin, et al.
Pubblicazione: (2024)
di: Park, Sungjin, et al.
Pubblicazione: (2024)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
di: Zhao, Qingqing, et al.
Pubblicazione: (2025)
di: Zhao, Qingqing, et al.
Pubblicazione: (2025)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
di: Chen, Yangyi, et al.
Pubblicazione: (2023)
di: Chen, Yangyi, et al.
Pubblicazione: (2023)
Chain-of-Thought Prompting for Demographic Inference with Large Multimodal Models
di: Yu, Yongsheng, et al.
Pubblicazione: (2024)
di: Yu, Yongsheng, et al.
Pubblicazione: (2024)
Training-Free Zero-Shot Anomaly Detection in 3D Brain MRI with 2D Foundation Models
di: Le-Gia, Tai, et al.
Pubblicazione: (2026)
di: Le-Gia, Tai, et al.
Pubblicazione: (2026)
From Intent to Execution: Multimodal Chain-of-Thought Reinforcement Learning for Precise CAD Code Generation
di: Niu, Ke, et al.
Pubblicazione: (2025)
di: Niu, Ke, et al.
Pubblicazione: (2025)
Advanced Knowledge Transfer: Refined Feature Distillation for Zero-Shot Quantization in Edge Computing
di: Hong, Inpyo, et al.
Pubblicazione: (2024)
di: Hong, Inpyo, et al.
Pubblicazione: (2024)
CATVis: Context-Aware Thought Visualization
di: Mehmood, Tariq, et al.
Pubblicazione: (2025)
di: Mehmood, Tariq, et al.
Pubblicazione: (2025)
Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
di: Xu, Qinwu, et al.
Pubblicazione: (2026)
di: Xu, Qinwu, et al.
Pubblicazione: (2026)
S-Chain: Structured Visual Chain-of-Thought For Medicine
di: Le-Duc, Khai, et al.
Pubblicazione: (2025)
di: Le-Duc, Khai, et al.
Pubblicazione: (2025)
Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
di: Li, Chengzu, et al.
Pubblicazione: (2025)
di: Li, Chengzu, et al.
Pubblicazione: (2025)
Thought Flow Nets: From Single Predictions to Trains of Model Thought
di: Schuff, Hendrik, et al.
Pubblicazione: (2021)
di: Schuff, Hendrik, et al.
Pubblicazione: (2021)
DiffBlender: Composable and Versatile Multimodal Text-to-Image Diffusion Models
di: Kim, Sungnyun, et al.
Pubblicazione: (2023)
di: Kim, Sungnyun, et al.
Pubblicazione: (2023)
Understanding normalization in contrastive representation learning and out-of-distribution detection
di: Le-Gia, Tai, et al.
Pubblicazione: (2023)
di: Le-Gia, Tai, et al.
Pubblicazione: (2023)
Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
ZIP: An Efficient Zeroth-order Prompt Tuning for Black-box Vision-Language Models
di: Park, Seonghwan, et al.
Pubblicazione: (2025)
di: Park, Seonghwan, et al.
Pubblicazione: (2025)
Controllable Feature Whitening for Hyperparameter-Free Bias Mitigation
di: Cho, Yooshin, et al.
Pubblicazione: (2025)
di: Cho, Yooshin, et al.
Pubblicazione: (2025)
MoPD: Mixture-of-Prompts Distillation for Vision-Language Models
di: Chen, Yang, et al.
Pubblicazione: (2024)
di: Chen, Yang, et al.
Pubblicazione: (2024)
In Search of a Data Transformation That Accelerates Neural Field Training
di: Seo, Junwon, et al.
Pubblicazione: (2023)
di: Seo, Junwon, et al.
Pubblicazione: (2023)
Mitigating Sexual Content Generation via Embedding Distortion in Text-conditioned Diffusion Models
di: Ahn, Jaesin, et al.
Pubblicazione: (2025)
di: Ahn, Jaesin, et al.
Pubblicazione: (2025)
MINR: Implicit Neural Representations with Masked Image Modelling
di: Lee, Sua, et al.
Pubblicazione: (2025)
di: Lee, Sua, et al.
Pubblicazione: (2025)
Sherlock: Self-Correcting Reasoning in Vision-Language Models
di: Ding, Yi, et al.
Pubblicazione: (2025)
di: Ding, Yi, et al.
Pubblicazione: (2025)
MTS-DMAE: Dual-Masked Autoencoder for Unsupervised Multivariate Time Series Representation Learning
di: Xu, Yi, et al.
Pubblicazione: (2025)
di: Xu, Yi, et al.
Pubblicazione: (2025)
FuRL: Visual-Language Models as Fuzzy Rewards for Reinforcement Learning
di: Fu, Yuwei, et al.
Pubblicazione: (2024)
di: Fu, Yuwei, et al.
Pubblicazione: (2024)
Bridge the Modality and Capability Gaps in Vision-Language Model Selection
di: Yi, Chao, et al.
Pubblicazione: (2024)
di: Yi, Chao, et al.
Pubblicazione: (2024)
Concept-skill Transferability-based Data Selection for Large Vision-Language Models
di: Lee, Jaewoo, et al.
Pubblicazione: (2024)
di: Lee, Jaewoo, et al.
Pubblicazione: (2024)
NeurNCD: Novel Class Discovery via Implicit Neural Representation
di: Wang, Junming, et al.
Pubblicazione: (2025)
di: Wang, Junming, et al.
Pubblicazione: (2025)
Hard Cases Detection in Motion Prediction by Vision-Language Foundation Models
di: Yang, Yi, et al.
Pubblicazione: (2024)
di: Yang, Yi, et al.
Pubblicazione: (2024)
Neural Predictor-Corrector: Solving Homotopy Problems with Reinforcement Learning
di: Mai, Jiayao, et al.
Pubblicazione: (2026)
di: Mai, Jiayao, et al.
Pubblicazione: (2026)
Structuring GUI Elements through Vision Language Models: Towards Action Space Generation
di: Xu, Yi, et al.
Pubblicazione: (2025)
di: Xu, Yi, et al.
Pubblicazione: (2025)
ReasoningTrack: Chain-of-Thought Reasoning for Long-term Vision-Language Tracking
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
Breast Cancer VLMs: Clinically Practical Vision-Language Train-Inference Models
di: Zheng, Shunjie-Fabian, et al.
Pubblicazione: (2025)
di: Zheng, Shunjie-Fabian, et al.
Pubblicazione: (2025)
Investigating Video Reasoning Capability of Large Language Models with Tropes in Movies
di: Su, Hung-Ting, et al.
Pubblicazione: (2024)
di: Su, Hung-Ting, et al.
Pubblicazione: (2024)
FairCoT: Enhancing Fairness in Text-to-Image Generation via Chain of Thought Reasoning with Multimodal Large Language Models
di: Sahili, Zahraa Al, et al.
Pubblicazione: (2024)
di: Sahili, Zahraa Al, et al.
Pubblicazione: (2024)
VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning
di: Li, Lingxiao, et al.
Pubblicazione: (2025)
di: Li, Lingxiao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Dreamweaver: Learning Compositional World Models from Pixels
di: Baek, Junyeob, et al.
Pubblicazione: (2025) -
An Investigation into Pre-Training Object-Centric Representations for Reinforcement Learning
di: Yoon, Jaesik, et al.
Pubblicazione: (2023) -
Learning to Compose: Improving Object Centric Learning by Injecting Compositionality
di: Jung, Whie, et al.
Pubblicazione: (2024) -
Concept Pinpoint Eraser for Text-to-image Diffusion Models via Residual Attention Gate
di: Lee, Byung Hyun, et al.
Pubblicazione: (2025) -
Parallelized Spatiotemporal Binding
di: Singh, Gautam, et al.
Pubblicazione: (2024)