Fine-tuned BLIP image captioning model trained on Flickr8k.
Fonte do modelo
Descrição da fonte
Fine-tuned BLIP image captioning model trained on Flickr8k.
Salesforce/blip-image-captioning-base
from transformers import BlipProcessor, BlipForConditionalGeneration
from PIL import Image
import torch
model_id = "muhammedaydiiinnn/blip-flickr8k-caption"
processor = BlipProcessor.from_pretrained(model_id)
model = BlipForConditionalGeneration.from_pretrained(model_id)
image = Image.open("test.jpg").convert("RGB")
inputs = processor(images=image, return_tensors="pt")
with torch.inference_mode():
output = model.generate(**inputs, max_new_tokens=30)
caption = processor.decode(output[0], skip_special_tokens=True)
print(caption)
Fontes
1 fonteVerificado 3 de set.
Artefatos de modelo
1 artefatoTrechos de fonte
2 trechos--- language: - en library_name: transformers pipeline_tag: image-to-text tags: - image-captioning - blip - vision-language license: mit --- # BLIP Flickr8k Caption Model Fine-tuned BLIP image captioning model trained on Flickr8k. ## Base model Salesforce/blip-image-captioning-base ## Usage ```python from transformers import BlipProcessor, BlipForConditionalGeneration from PIL import Image import torch model_id = "muhammedaydiiinnn/blip-flickr8k-caption" processor = BlipProcessor.from_pretrained(model_id) model = BlipForConditionalGeneration.from_pretrained(model_id) image = Image.open("test.jpg").convert("RGB") inputs = processor(images=image, return_tensors="pt") with torch.inference_mode(): output = model.generate(**inputs, max_new_tokens=30) caption = processor.decode(output[0], skip_special_tokens=True) print(caption)
Source context: 3 downloads · 0 likes · Pipeline image-to-text · Library transformers · Repo muhammedaydiiinnn/blip-flickr8k-caption