ViTP (Visual Instruction Pretraining) vision backbone — InternVL 1B variant pretrained on remote sensing domain visual instruction data. Compatible with InternVisionModel from InternVL.
Fuente del modelo
Descripción de la fuente
ViTP (Visual Instruction Pretraining) vision backbone — InternVL 1B variant pretrained on remote sensing domain visual instruction data. Compatible with InternVisionModel from InternVL.
Fuentes
1 fuenteVerificado 19 ago
Artefactos del modelo
1 artefactoExtractos de fuentes
2 extractosThe model repo includes the modeling code. Load with transformers (no ViTP repo needed):
from transformers import AutoModel, AutoImageProcessor
import torch
device = "cuda"
model = AutoModel.from_pretrained(
"BiliSakura/ViTP-InternVL-1B-RS",
trust_remote_code=True,
torch_dtype=torch.bfloat16,
device_map=device,
).eval()
processor = AutoImageProcessor.from_pretrained("BiliSakura/ViTP-InternVL-1B-RS")
pixel_values = processor(images="image.jpg", return_tensors="pt").pixel_values.to(device, model.dtype)
with torch.no_grad():
outputs = model(pixel_values=pixel_values)
# Pooled CLS token: (1, 1024)
features = outputs.pooler_output
# Or full sequence: outputs.last_hidden_state
@article{Li_2025_ViTP,
title={Visual Instruction Pretraining for Domain-Specific Foundation Models},
author={Li, Yuxuan and Zhang, Yicheng and Tang, Wenhao and Dai, Yimian and Cheng, Ming-Ming and Li, Xiang and Yang, Jian},
journal={arXiv},
year={2025}
}
--- license: cc-by-nc-4.0 tags: - vision - image-classification - vit - ViTP - InternVL - domain-adaptation - remote-sensing language: - en library_name: transformers pipeline_tag: image-feature-extraction base_model: - GreatBird/ViTP --- # ViTP-InternVL-1B-RS ViTP (Visual Instruction Pretraining) vision backbone — **InternVL 1B** variant pretrained on **remote sensing** domain visual instruction data. Compatible with `InternVisionModel` from [InternVL](https://github.com/OpenGVLab/InternVL). ## Model Details - **Architecture**: InternVisionModel (24 layers, 1024 hidden, 16 heads) - **Image size**: 448×448 - **Patch size**: 14 - **Domain**: Remote sensing ## Usage The model repo includes the modeling code. Load with `transformers` (no ViTP repo needed): ```python from transformers import AutoModel, AutoImageProcessor import torch device = "cuda" model = AutoModel.from_pretrained( "BiliSakura/ViTP-InternVL-1B-RS", trust_remote_code=True, torch_dtype=torch.bfloat16, device_map=device, ).eval() processor = AutoImageProcessor.from_pretrained("BiliSakura/ViTP-InternVL-1B-RS") pixel_values = processor(images="image.jpg", return_tensors="pt").pixel_values.to(device, model.dtype) with torch.no_grad(): outputs = model(pixel_values=pixel_values) # Pooled CLS token: (1, 1024) features = outputs.pooler_output # Or full sequence: outputs.last_hidden_state ``` ## Citation ```bibtex @article{Li_2025_ViTP, title={Visual Instruction Pretraining for Domain-Specific Foundation Models}, author={Li, Yuxuan and Zhang, Yicheng and Tang, Wenhao and Dai, Yimian and Cheng, Ming-Ming and Li, Xiang and Yang, Jian}, journal={arXiv}, year={2025} } ```
Source context: 3 downloads · 0 likes · Pipeline image-feature-extraction · Library transformers · Repo BiliSakura/ViTP-InternVL-1B-RS