geniml

Learn unsupervised embeddings from genomic interval data for region-level similarity and clustering.

18|1|Updated Dec 27, 2025
One-click install
npx skills add https://github.com/LogauaEngstrom/claude-scientific-skills --skill geniml-logauaengstrom
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: geniml
Source: https://github.com/LogauaEngstrom/claude-scientific-skills/tree/main/scientific-skills/geniml
Command: npx skills add https://github.com/LogauaEngstrom/claude-scientific-skills --skill geniml-logauaengstrom

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

Geniml provides a flexible framework to learn unsupervised embeddings from genomic interval data (BED files), enabling region- and cell-level representations for similarity search, clustering, and downstream machine learning.

Core Features & Use Cases

  • Region2Vec: Train region embeddings from BED data for dimensionality reduction and feature vectors.
  • BEDspace: Joint region and metadata embeddings for metadata-aware queries.
  • scEmbed: Single-cell chromatin accessibility embeddings for scATAC-seq analysis and clustering.
  • Universe-building: Construct consensus universes to standardize tokenization across datasets and improve tokenization quality.
  • Utilities: Supporting tools for caching, tokenization, evaluation, and search.

Quick Start

Install geniml, prepare a universe BED file, tokenize BED files, and train a Region2Vec model to generate embeddings.

Frequently Asked Questions about geniml

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I generate genomic embeddings from BED files for clustering?▼

To generate genomic embeddings from BED files, you can use unsupervised learning methods like Region2Vec to transform interval data into region-level feature vectors for similarity search and clustering. This requires tokenizing BED files against a predefined universe.

What is scEmbed used for in scATAC-seq analysis?▼

scEmbed is used for single-cell chromatin accessibility embeddings in scATAC-seq analysis to generate cell-level representations. These embeddings enable downstream clustering and similarity retrieval directly from sparse single-cell genomic interval data.

Can I integrate metadata into genomic interval embeddings?▼

Yes, you can integrate metadata into genomic interval embeddings using the BEDspace method. BEDspace creates joint region and metadata embeddings, enabling metadata-aware queries and downstream machine learning tasks on BED collections.

How do I standardize tokenization across multiple genomic datasets?▼

To standardize tokenization across multiple genomic datasets, construct a consensus universe BED file. Universe-building workflows standardize tokenization across datasets, improving region-level embedding quality and ensuring consistent feature vector generation.

Does geniml require any external dependencies to process genomic intervals?▼

No, geniml does not require external dependencies to process genomic intervals and generate embeddings. It provides a self-contained Python API and CLI interface supporting tokenization, caching, evaluation, and search utilities.

What is the best way to retrieve similar genomic regions from a BED collection?▼

The best way to retrieve similar genomic regions from a BED collection is by training unsupervised region embeddings using Region2Vec. These learned feature vectors enable direct region-level similarity search and retrieval.