databricks-spark-structured-streaming

Design and operate Spark Structured Streaming pipelines with Kafka, Delta Lake, and multi-sink architectures.

1|Updated Dec 15, 2025
One-click install
npx skills add https://github.com/lucaslessachaves/default --skill databricks-spark-structured-streaming-lucaslessachaves
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: databricks-spark-structured-streaming
Source: https://github.com/lucaslessachaves/default/tree/main/.claude/skills/databricks-spark-structured-streaming
Command: npx skills add https://github.com/lucaslessachaves/default --skill databricks-spark-structured-streaming-lucaslessachaves

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Patterns and best practices to design, implement, and optimize Spark Structured Streaming pipelines for production-grade workloads.

Core Features & Use Cases

  • Comprehensive patterns for Kafka streaming, stream-stream joins, stream-static joins, and multi-sink writes.
  • Guidance on production readiness including RTM, triggers, watermarks, state stores, monitoring, and cost optimization.
  • Real-world use cases across Bronze/Silver/Gold medallion architectures and CDC scenarios.

Quick Start

Apply a basic Kafka-to-Delta streaming example using the included patterns to validate end-to-end behavior.

Frequently Asked Questions about databricks-spark-structured-streaming

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I build production-ready Spark Structured Streaming pipelines with Kafka and Delta Lake?▼

Production-ready Spark Structured Streaming pipelines use patterns for Kafka ingestion, Delta Lake sinks, multi-sink writes, watermarks, and state management to ensure reliable streaming workloads.

What's the best way to optimize costs in Spark Structured Streaming workloads?▼

Cost optimization in Spark Structured Streaming involves configuring triggers, managing state stores efficiently, and applying watermark strategies to control resource consumption during processing.

How do I implement triggers and watermarks for state management in Spark Streaming?▼

Triggers and watermarks in Spark Streaming define processing time boundaries and handle late data, which configures state management for reliable event-time processing across pipelines.

Can I use Spark Structured Streaming for CDC scenarios and medallion architectures?▼

Spark Structured Streaming supports Change Data Capture scenarios and Bronze/Silver/Gold medallion architectures through stream-static joins and multi-sink write patterns.

Does Spark Structured Streaming support stream-stream joins and multi-sink writes?▼

Spark Structured Streaming supports stream-stream joins and multi-sink writes, providing comprehensive patterns to route and aggregate data across multiple downstream targets.

Why do I need checkpoints when designing Kafka to Delta Lake streaming pipelines?▼

Checkpoints in Kafka to Delta Lake streaming pipelines maintain state and recovery information, preventing data loss and duplication during job restarts or failures.