Advancing ALS Applications with Large-Scale Pre-training: Dataset Development and Downstream Assessment
Fuente:
arXiv
Saved in:
| Main Authors: | Xiu, Haoyi, Liu, Xin, Kim, Taehoon, Kim, Kyoung-Sook |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Downstream Transfer Attack: Adversarial Attacks on Downstream Models with Pre-trained Vision Transformers
by: Zheng, Weijie, et al.
Published: (2024)
by: Zheng, Weijie, et al.
Published: (2024)
Future-Proof Yourself: An AI Era Survival Guide
by: Kim, Taehoon
Published: (2025)
by: Kim, Taehoon
Published: (2025)
Med-GLIP: Advancing Medical Language-Image Pre-training with Large-scale Grounded Dataset
by: Deng, Ziye, et al.
Published: (2025)
by: Deng, Ziye, et al.
Published: (2025)
ALPS: An Auto-Labeling and Pre-training Scheme for Remote Sensing Segmentation With Segment Anything Model
by: Zhang, Song, et al.
Published: (2024)
by: Zhang, Song, et al.
Published: (2024)
DanQing: An Up-to-Date Large-Scale Chinese Vision-Language Pre-training Dataset
by: Shen, Hengyu, et al.
Published: (2026)
by: Shen, Hengyu, et al.
Published: (2026)
Understanding and Mitigating the Label Noise in Pre-training on Downstream Tasks
by: Chen, Hao, et al.
Published: (2023)
by: Chen, Hao, et al.
Published: (2023)
Robots Pre-train Robots: Manipulation-Centric Robotic Representation from Large-Scale Robot Datasets
by: Jiang, Guangqi, et al.
Published: (2024)
by: Jiang, Guangqi, et al.
Published: (2024)
Long-Tailed Recognition on Binary Networks by Calibrating A Pre-trained Model
by: Kim, Jihun, et al.
Published: (2024)
by: Kim, Jihun, et al.
Published: (2024)
MAFA: Managing False Negatives for Vision-Language Pre-training
by: Byun, Jaeseok, et al.
Published: (2023)
by: Byun, Jaeseok, et al.
Published: (2023)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
by: Zhang, Xinsong, et al.
Published: (2025)
by: Zhang, Xinsong, et al.
Published: (2025)
Large-Scale 3D Medical Image Pre-training with Geometric Context Priors
by: Wu, Linshan, et al.
Published: (2024)
by: Wu, Linshan, et al.
Published: (2024)
Merge and Bound: Direct Manipulations on Weights for Class Incremental Learning
by: Kim, Taehoon, et al.
Published: (2025)
by: Kim, Taehoon, et al.
Published: (2025)
Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation
by: Kim, Taehoon, et al.
Published: (2025)
by: Kim, Taehoon, et al.
Published: (2025)
Contribution-based Low-Rank Adaptation with Pre-training Model for Real Image Restoration
by: Park, Donwon, et al.
Published: (2024)
by: Park, Donwon, et al.
Published: (2024)
Exploiting Style Latent Flows for Generalizing Deepfake Video Detection
by: Choi, Jongwook, et al.
Published: (2024)
by: Choi, Jongwook, et al.
Published: (2024)
Probabilistic Wildfire Spread Prediction Using an Autoregressive Conditional Generative Adversarial Network
by: Kang, Taehoon, et al.
Published: (2025)
by: Kang, Taehoon, et al.
Published: (2025)
Preserving Multi-Modal Capabilities of Pre-trained VLMs for Improving Vision-Linguistic Compositionality
by: Oh, Youngtaek, et al.
Published: (2024)
by: Oh, Youngtaek, et al.
Published: (2024)
VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
by: Jia, Ziheng, et al.
Published: (2025)
by: Jia, Ziheng, et al.
Published: (2025)
Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues
by: Kim, Youngmin, et al.
Published: (2025)
by: Kim, Youngmin, et al.
Published: (2025)
D3T: Distinctive Dual-Domain Teacher Zigzagging Across RGB-Thermal Gap for Domain-Adaptive Object Detection
by: Do, Dinh Phat, et al.
Published: (2024)
by: Do, Dinh Phat, et al.
Published: (2024)
Pre-Trained Model Recommendation for Downstream Fine-tuning
by: Bai, Jiameng, et al.
Published: (2024)
by: Bai, Jiameng, et al.
Published: (2024)
Scientific Image Synthesis: Benchmarking, Methodologies, and Downstream Utility
by: Lin, Honglin, et al.
Published: (2026)
by: Lin, Honglin, et al.
Published: (2026)
OmniScience: A Large-scale Multi-modal Dataset for Scientific Image Understanding
by: Tao, Haoyi, et al.
Published: (2026)
by: Tao, Haoyi, et al.
Published: (2026)
Enhancing Adversarial Transferability in Visual-Language Pre-training Models via Local Shuffle and Sample-based Attack
by: Liu, Xin, et al.
Published: (2025)
by: Liu, Xin, et al.
Published: (2025)
Difficulty-guided Sampling: Bridging the Target Gap between Dataset Distillation and Downstream Tasks
by: Li, Mingzhuo, et al.
Published: (2026)
by: Li, Mingzhuo, et al.
Published: (2026)
MITS: A Large-Scale Multimodal Benchmark Dataset for Intelligent Traffic Surveillance
by: Zhao, Kaikai, et al.
Published: (2025)
by: Zhao, Kaikai, et al.
Published: (2025)
Dataset Ownership Verification in Contrastive Pre-trained Models
by: Xie, Yuechen, et al.
Published: (2025)
by: Xie, Yuechen, et al.
Published: (2025)
Preserving Pre-trained Representation Space: On Effectiveness of Prefix-tuning for Large Multi-modal Models
by: Kim, Donghoon, et al.
Published: (2024)
by: Kim, Donghoon, et al.
Published: (2024)
Stable Diffusion Dataset Generation for Downstream Classification Tasks
by: Lomurno, Eugenio, et al.
Published: (2024)
by: Lomurno, Eugenio, et al.
Published: (2024)
Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
by: Lai, Zhengfeng, et al.
Published: (2024)
by: Lai, Zhengfeng, et al.
Published: (2024)
RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training
by: Nie, Yunshuang, et al.
Published: (2026)
by: Nie, Yunshuang, et al.
Published: (2026)
Targeted Downstream-Agnostic Attack
by: Lei, Zhuxin, et al.
Published: (2026)
by: Lei, Zhuxin, et al.
Published: (2026)
Reciprocal Attention Mixing Transformer for Lightweight Image Restoration
by: Choi, Haram, et al.
Published: (2023)
by: Choi, Haram, et al.
Published: (2023)
Traj-LLM: A New Exploration for Empowering Trajectory Prediction with Pre-trained Large Language Models
by: Lan, Zhengxing, et al.
Published: (2024)
by: Lan, Zhengxing, et al.
Published: (2024)
Closed-Form Linear-Probe Dataset Distillation for Pre-trained Vision Models
by: Peng, Bincheng, et al.
Published: (2026)
by: Peng, Bincheng, et al.
Published: (2026)
Beyond Spatial Frequency: Pixel-wise Temporal Frequency-based Deepfake Video Detection
by: Kim, Taehoon, et al.
Published: (2025)
by: Kim, Taehoon, et al.
Published: (2025)
Large-Scale Universal Defect Generation: Foundation Models and Datasets
by: Fan, Yuanting, et al.
Published: (2026)
by: Fan, Yuanting, et al.
Published: (2026)
DeClotH: Decomposable 3D Cloth and Human Body Reconstruction from a Single Image
by: Nam, Hyeongjin, et al.
Published: (2025)
by: Nam, Hyeongjin, et al.
Published: (2025)
Integrating Text and Image Pre-training for Multi-modal Algorithmic Reasoning
by: Zhang, Zijian, et al.
Published: (2024)
by: Zhang, Zijian, et al.
Published: (2024)
Masked Self-Supervised Pre-Training for Text Recognition Transformers on Large-Scale Datasets
by: Kišš, Martin, et al.
Published: (2025)
by: Kišš, Martin, et al.
Published: (2025)
Similar Items
-
Downstream Transfer Attack: Adversarial Attacks on Downstream Models with Pre-trained Vision Transformers
by: Zheng, Weijie, et al.
Published: (2024) -
Future-Proof Yourself: An AI Era Survival Guide
by: Kim, Taehoon
Published: (2025) -
Med-GLIP: Advancing Medical Language-Image Pre-training with Large-scale Grounded Dataset
by: Deng, Ziye, et al.
Published: (2025) -
ALPS: An Auto-Labeling and Pre-training Scheme for Remote Sensing Segmentation With Segment Anything Model
by: Zhang, Song, et al.
Published: (2024) -
DanQing: An Up-to-Date Large-Scale Chinese Vision-Language Pre-training Dataset
by: Shen, Hengyu, et al.
Published: (2026)