Připojení k syncsortu

Důležité

Tato funkce je ve verzi Public Preview.

Syncsort vám pomůže rozdělit sila dat integrací starších verzí, sálových počítačů a dat IBM s Azure Databricks. Data z těchto zdrojů můžete snadno načíst do Delta Lake.

Tady je postup použití nástroje Syncsort s Azure Databricks.

Krok 1: Vygenerování tokenu pat Databricks

Synchronizuje se pomocí Azure Databricks pomocí tokenu pat přístupového tokenu Azure Databricks.

Poznámka:

Osvědčeným postupem při ověřování pomocí automatizovaných nástrojů, systémů, skriptů a aplikací doporučuje Databricks místo uživatelů pracovního prostoru používat tokeny patního přístupu, které patří instančním objektům . Pokud chcete vytvořit tokeny pro instanční objekty, přečtěte si téma Správa tokenů instančního objektu.

Krok 2: Nastavení clusteru pro podporu potřeb integrace

Syncsort zapíše data do cesty azure Data Lake Storage a cluster integrace Azure Databricks bude číst data z daného umístění. Proto integrační cluster vyžaduje zabezpečený přístup k cestě Azure Data Lake Storage.

Zabezpečený přístup k cestě azure Data Lake Storage

K zabezpečení přístupu k datům v Azure Data Lake Storage (ADLS) můžete použít přístupový klíč účtu úložiště Azure (doporučeno) nebo instanční objekt Microsoft Entra ID.

Použití přístupového klíče účtu úložiště Azure

Přístupový klíč účtu úložiště můžete nakonfigurovat v integračním clusteru jako součást konfigurace Sparku. Ujistěte se, že má účet úložiště přístup ke kontejneru ADLS a systému souborů, který se používá pro přípravná data a kontejner ADLS a systém souborů, do kterého chcete zapisovat tabulky Delta Lake. Pokud chcete nakonfigurovat cluster integrace tak, aby používal klíč, postupujte podle kroků v tématu Připojení k Azure Data Lake Storage Gen2 a Blob Storage.

Použití instančního objektu Microsoft Entra ID

Instanční objekt můžete nakonfigurovat v clusteru integrace Azure Databricks jako součást konfigurace Sparku. Ujistěte se, že má instanční objekt přístup ke kontejneru ADLS, který se používá pro přípravná data, a kontejnerU ADLS, do kterého chcete zapisovat tabulky Delta. Pokud chcete nakonfigurovat integrační cluster tak, aby používal instanční objekt, postupujte podle kroků v Accessu ADLS Gen2 s instančním objektem.

Zadání konfigurace clusteru

  1. Nastavte režim clusteru na standardní.

  2. Nastavte verzi Modulu runtime Databricks na verzi modulu runtime Databricks.

  3. Povolte optimalizované zápisy a automatické komprimace přidáním následujících vlastností do konfigurace Sparku:

    spark.databricks.delta.optimizeWrite.enabled true
    spark.databricks.delta.autoCompact.enabled true
    
  4. Nakonfigurujte cluster v závislosti na potřebách integrace a škálování.

Podrobnosti o konfiguraci clusteru najdete v referenčních informacích ke konfiguraci výpočetních prostředků.

Postup získání adresy URL JDBC a cesty HTTP najdete v tématu Získání podrobností o připojení pro výpočetní prostředek Azure Databricks.

Krok 3: Získání podrobností o připojení JDBC a ODBC pro připojení ke clusteru

Pokud chcete připojit cluster Azure Databricks k nástroji Syncsort, potřebujete následující vlastnosti připojení JDBC/ODBC:

  • JDBC URL
  • Cesta HTTP

Krok 4: Konfigurace synchronizace s Azure Databricks

Přejděte na přihlašovací stránku Databricks a Připojit pro velké objemy dat a postupujte podle pokynů.

Další materiály

Podpora