huggingface-vision-trainer

Train and fine-tune vision models with Hugging Face Transformers and Jobs.

Updated Jun 15, 2026
One-click install
npx skills add https://github.com/Andrew-Girgis/token-holdem --skill huggingface-vision-trainer-andrew-girgis
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: huggingface-vision-trainer
Source: https://github.com/Andrew-Girgis/token-holdem/tree/main/.agents/skills/huggingface-vision-trainer
Command: npx skills add https://github.com/Andrew-Girgis/token-holdem --skill huggingface-vision-trainer-andrew-girgis

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires transformers, datasets, monai, trackio, and includes scripts (resource) and references (resource) and assets (resource) components.

What problem does it solve?

This Skill addresses the complexity and time-consuming nature of training and fine-tuning vision models. It provides a streamlined, cloud-based experience using Hugging Face Transformers and Hugging Face Jobs.

Core Features & Use Cases

  • Cloud-Based Training: Leverage managed cloud GPUs for scalable and efficient training.
  • Hugging Face Transformers Integration: Utilize state-of-the-art vision models from Hugging Face Transformers library.
  • Dataset Preparation: Automate the preparation of COCO-format datasets with Albumentations augmentation.
  • Evaluation: Perform mAP/mAR evaluation and track accuracy metrics.
  • Use Case: A user can train a segmentation model for image matting by simply providing a dataset with image and mask columns, and specifying the appropriate prompts.

Quick Start

To train a SAM2 segmentation model on the 'MicroMat-mini' dataset, use the following command: uv run huggingface-vision-trainer.py --model_name_or_path "facebook/sam2.1-hiera-small" --dataset_name "merve/MicroMat-mini" --prompt_type "bbox" --prompt_column_name "prompt" --output_dir "sam2-finetuned" --num_train_epochs 30 --per_device_train_batch_size 4 --learning_rate 1e-5 --logging_steps 1 --save_strategy "epoch" --save_total_limit 2 --remove_unused_columns False --dataloader_pin_memory False --push_to_hub True --hub_model_id "username/sam2-finetuned" --do_train True --report_to "trackio" --report_to "tensorboard" --tensorboard_log_dir "tensorboard_logs".

Frequently Asked Questions about huggingface-vision-trainer

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I fine-tune a Hugging Face vision model for object detection or segmentation?▼

Fine-tune Hugging Face vision models for object detection and segmentation by running cloud-based training jobs with Hugging Face Transformers, handling COCO-format dataset preparation and evaluation automatically.

What's the best way to train a SAM2 segmentation model using cloud GPUs?▼

Train SAM2 segmentation models on cloud GPUs by providing a dataset with image and mask columns, specifying bbox or point prompts, and configuring DiceCE loss with Hugging Face Jobs.

Does Hugging Face Jobs support Albumentations augmentation for COCO-format datasets?▼

Yes, Hugging Face Jobs supports Albumentations augmentation by automating the preparation of COCO-format datasets during the vision model training pipeline.

Can I track mAP and mAR evaluation metrics when training image classification models?▼

Track mAP and mAR evaluation metrics alongside accuracy metrics for image classification models using Trackio and Tensorboard monitoring integrations during Hugging Face Jobs training.

How do I estimate hardware costs and select GPUs for Hugging Face Transformers training?▼

Estimate hardware costs and select cloud GPUs for Hugging Face Transformers training through built-in hardware selection and cost estimation features provided by Hugging Face Jobs infrastructure.

What are the limitations of using Hugging Face Jobs for vision model fine-tuning?▼

Hugging Face Jobs fine-tuning requires Hugging Face Transformers and Jobs infrastructure dependencies, limiting usage to environments where these specific platform dependencies are available.