Skip to content

Bob+ Skills and Modes – Data

IBM Bob ships with purpose-built Skills and Custom Modes for every Data building block, giving engineers an AI-assisted workflow to plan, build, configure, and operate data integration, intelligence, and retrieval capabilities directly from their IDE.

How to install the Skills

The Skills have been packed into a single .zip that you can easily download and install. Go to the skills.zip page and click the Download raw file icon at the upper-right of the page. Copy all skill folders at either the global, ~/.bob/skills, or project-level, <project>/.bob/skills

Skill Taxonomy

Each Skill for IBM Building Blocks often aligns with an IBM product but not always. For specifics on how each skill works, read through the associated SKILL.md.

Data Skills
Context

Data-streaming: Confluent
Works with the Confluent Platform for real-time data streaming, Kafka topic management, stream processing configuration, and data pipeline setup for event-driven architectures.

Data-streaming: Confluent plus Terraform
Expert guidance for building real-time streaming systems on Confluent Cloud using Infrastructure-as-Code (Terraform), Apache Flink SQL, and Python producers. Adapts to any streaming use case (IoT, finance, retail, healthcare, logistics) while maintaining production-ready quality.

Data Ingestion: Structured
IBM DataStage connector config, CDC pipeline design, schema mapping, DB2/PostgreSQL/MySQL/Oracle patterns, batch and incremental load strategies into IBM watsonx.data.

Data Ingestion: Unstructured
IBM Docling document parsing, UDI pipeline configuration, IBM COS ingestion, multi-format chunking (PDF, DOCX, HTML, images), metadata extraction, Python 3.12 automation scripts.

Data Ingestion: UDI + OpenSearch
IBM UDI + OpenSearch integration, document search pipeline setup, OpenSearch index provisioning for UDI output into IBM watsonx.data.

Data Observability: Databand Pipeline Setup
IBM Databand pipeline onboarding, OpenLineage event design (START / COMPLETE / FAIL), alert policy authoring (null-rate, schema-drift, SLA-breach), IBM IAM auth patterns.

Pipelines

Text2SQL: Metadata Enrichment
watsonx.data Intelligence project onboarding, table/column description enrichment, synonym design, query example authoring, accuracy measurement. Maximises Text2SQL query accuracy.

Text2SQL: Query Optimizer
Model selection (Granite vs Llama), SQL safety validation, accuracy evaluation (exact-match + execution accuracy), error pattern diagnosis, SQL dialect tuning (Presto, PostgreSQL, Oracle, Snowflake).

Data Lineage: OpenLineage Instrumentation
OpenLineage event design, Python/DataStage/Spark instrumentation patterns, IBM Databand lineage API integration, lineage graph authoring for end-to-end data traceability.

Data Quality: Rules
Data quality rule authoring, watsonx.data Intelligence quality checks, profiling automation, threshold design, compliance reporting patterns for AI-ready data.

Query Engines

RAG Pipeline Builder
Complete RAG pipeline design — IBM watsonx.ai embedding integration, OpenSearch HNSW + hybrid search design, chunking strategy selection, FastAPI service patterns, RAG evaluation with RAGAS metrics.

RAG MCP Server Builder
MCP server development (SSE transport, FastMCP), RAG ingestion + retrieval tool design (`ingest_from_cos`, `search_documents`, `ask_question`), IBM Bob / Claude integration, deployment to IBM Code Engine.

Vector Search: OpenSearch
IBM watsonx.data OpenSearch k-NN index design, HNSW parameter tuning (`ef_construction`, `m`), hybrid search (vector + BM25) score fusion, IBM watsonx.ai embedding integration.

Vector Search: AstraDB
Astra DB vector collection creation, IBM watsonx.ai embedding integration, ANN cosine search queries via `astrapy` Data API, IBM COS ingestion patterns for IBM HCD.


Data Modes

Instructions and related files for these custom modes can be found in their respective repository.

Data Modes
Context

Data Ingestion
AI-generated data pipeline mode for both structured (DataStage CDC) and unstructured (Docling/UDI) sources. Describe your data source and target — Bob generates the complete ingestion pipeline automatically.

Data Observability Builder
IBM Databand pipeline onboarding, OpenLineage instrumentation for Python/DataStage/Spark, alert policy design and quality threshold tuning, IBM COS report archiving.

Pipelines

Text-to-SQL
Natural language to SQL using IBM watsonx.data Intelligence Text2SQL API. Bob helps build the FastAPI application, enrich database metadata (table/column descriptions, synonyms), and evaluate SQL accuracy across Presto, PostgreSQL, Oracle, and Snowflake dialects.

Data Lineage Builder
End-to-end lineage tracking with IBM Manta and watsonx.data Intelligence. Bob assists with OpenLineage instrumentation, impact analysis, compliance reporting, and lineage visualization.

Data Quality Builder
Data quality rule authoring and monitoring with watsonx.data Intelligence. Bob helps define validation rules, configure profiling, set quality thresholds, and build compliance reports.

Query Engines

RAG Builder
End-to-end RAG architect — pipeline architecture, hybrid search design, chunking strategy, IBM watsonx.ai embedding model choice, MCP server design, RAG evaluation (RAGAS).

RAG Ingestion Builder
Focused ingestion specialist — IBM COS document loading, chunking, watsonx.ai embedding, OpenSearch indexing, MCP ingestion tool design (`ingest_from_cos`).

RAG Retrieval Builder
Focused retrieval and generation specialist — hybrid search queries, reranking, watsonx.ai Granite generation, RAGAS evaluation, streaming SSE responses, MCP retrieval tools.

OpenSearch Builder
IBM watsonx.data OpenSearch k-NN index design, HNSW parameter tuning, hybrid search score fusion, IBM watsonx.ai embedding integration for standalone vector search services.

Astra DB Vector Builder
DataStax Astra DB (IBM HCD) vector collection design, `astrapy` ANN search patterns, IBM watsonx.ai embedding integration, IBM COS ingestion for serverless global vector storage.


For the complete list of all Building Block skills across AI, Data, and Automation, see the Bob+ Skills page.