Kopírování dat z Amazon Redshiftu pomocí Azure Data Factory nebo Synapse Analytics

VZTAHUJE SE NA: Azure Data Factory Azure Synapse Analytics

Návod

Data Factory v Microsoft Fabric je nová generace Azure Data Factory s jednodušší architekturou, integrovanou AI a novými funkcemi. Pokud s integrací dat začínáte, začněte Fabric Data Factory. Stávající úlohy ADF lze upgradovat na Fabric pro přístup k novým funkcím v oblastech datové vědy, analýz v reálném čase a vytváření sestav.

Tento článek popisuje, jak pomocí aktivity kopírování v kanálech Azure Data Factory a Synapse Analytics kopírovat data z Amazon Redshiftu. Vychází z článku přehled aktivity kopírování, který představuje obecný přehled aktivity kopírování.

Poznámka:

Tento konektor je také k dispozici ve službě Data Factory v Microsoft Fabric. Informace o konfiguraci a funkcích specifických pro Fabric najdete v dokumentaci ke konektoru Fabric Amazon Redshift.

Důležité

Konektor Amazon Redshift verze 1.0 je ve fázi odebrání. Doporučujeme upgradovat konektor Amazon Redshift z verze 1.0 na verzi 2.0.

Podporované funkce

Tento konektor Amazon Redshift je podporovaný pro následující funkce:

Podporované funkce IR
aktivita Copy (zdroj/-) (1) (2)
Vyhledávací aktivita (1) (2)

(1) Azure Integration Runtime (2) Lokálně hostované Integration Runtime

Seznam úložišť dat podporovaných jako zdroje nebo jímky aktivitou kopírování najdete v tabulce Podporované úložiště dat.

Služba poskytuje integrovaný ovladač, který umožňuje připojení, a proto nemusíte ručně instalovat žádný ovladač.

Konektor Amazon Redshift podporuje načítání dat z Redshiftu pomocí dotazu nebo integrované podpory redshift UNLOAD.

Konektor podporuje verze Windows uvedené v tomto článku.

Návod

Pokud chcete dosáhnout nejlepšího výkonu při kopírování velkých objemů dat z Redshiftu, zvažte použití integrované funkce Redshift UNLOAD prostřednictvím AmazonU S3. Podrobnosti najdete v části Použití funkce UNLOAD ke kopírování dat z oddílu Amazon Redshift .

Požadavky

Pokud kopírujete data do lokálního datového úložiště pomocí samohostitelného Integration Runtime, udělte samohostitelnému Integration Runtime (použijte IP adresu počítače) přístup ke clusteru Amazon Redshift. Pokyny najdete v tématu Autorizace přístupu ke clusteru . Pro verzi 2.0 by vaše verze místního prostředí Integration Runtime měla být 5.60 nebo vyšší.

Pokud kopírujete data do úložiště dat Azure, podívejte se na Rozsahy IP adres datových center Azure pro rozsahy IP adres výpočetních a SQL používaných datovými centry Azure.

Pokud je vaše úložiště dat spravovanou cloudovou datovou službou, můžete použít Azure Integration Runtime. Pokud je přístup omezený na IP adresy schválené v pravidlech brány firewall, můžete do seznamu povolených přidat ip adresy Azure Integration Runtime.

Funkci managed virtual network Integration Runtime můžete také použít v Azure Data Factory pro přístup k místní síti bez nutnosti instalace a konfigurace místního prostředí Integration Runtime.

Začínáme

K provedení aktivity kopírování pomocí datového kanálu můžete použít jeden z následujících nástrojů nebo sad SDK:

Vytvoření propojené služby pro Amazon Redshift pomocí uživatelského rozhraní

Pomocí následujícího postupu vytvořte propojenou službu s Amazon Redshiftem v uživatelském rozhraní portálu Azure.

  1. Přejděte na kartu Spravovat v pracovním prostoru Azure Data Factory nebo Synapse a vyberte Propojené služby a potom klikněte na Nový:

  2. Vyhledejte Amazon a vyberte konektor Amazon Redshift.

    Vyberte konektor Amazon Redshift.

  3. Nakonfigurujte podrobnosti o službě, otestujte připojení a vytvořte novou propojenou službu.

    Nakonfigurujte propojenou službu na Amazon Redshift.

Podrobnosti konfigurace konektoru

Následující části obsahují podrobnosti o vlastnostech, které slouží k definování entit služby Data Factory specifických pro konektor Amazon Redshift.

Vlastnosti propojené služby

Propojená služba Amazon Redshift podporuje následující vlastnosti:

Vlastnost Popis Požadováno
typ Vlastnost typu musí být nastavená na: AmazonRedshift. Ano
verze Zadaná verze. Ano pro verzi 2.0.
server IP adresa nebo název hostitele serveru Amazon Redshift. Ano
port Počet portu TCP, který server Amazon Redshift používá k naslouchání klientským připojením. Ne, výchozí hodnota je 5439
databáze Název databáze Amazon Redshift. Ano
uživatelské jméno Jméno uživatele, který má přístup k databázi. Ano
heslo Heslo pro uživatelský účet. Označte toto pole jako SecureString pro jeho bezpečné uložení, nebo odkazujte na tajemství uložené v Azure Key Vault. Ano
sslmode Režim ověření certifikátu SSL, který se použije při připojování k Amazon Redshiftu. Tato vlastnost je podporována pouze ve verzi 2.0.
- Verify_full: Připojte se jenom pomocí PROTOKOLU SSL, důvěryhodné certifikační autority a názvu serveru, který odpovídá certifikátu.
- Verify_ca: Připojení pouze pomocí SSL a důvěryhodné certifikační autority.
- Povinné: Připojte se jenom pomocí SSL.
- Upřednostňovaný: Pokud je k dispozici, připojte se pomocí protokolu SSL. V opačném případě se připojte bez použití protokolu SSL.
- Povoleno: Ve výchozím nastavení se připojte bez použití PROTOKOLU SSL. Pokud server vyžaduje připojení SSL, použijte protokol SSL.
- Zakázáno: Připojení bez použití PROTOKOLU SSL.
Možnosti: verify-full (výchozí) / verify-ca / require / prefer / allow / disable
Ne, výchozí hodnota je verify-full
connectVia Integration Runtime pro připojení k úložišti dat. Můžete použít Azure Integration Runtime nebo Integration Runtime v místním prostředí (pokud je vaše úložiště dat umístěné v privátní síti). Pokud není zadaný, použije výchozí Azure Integration Runtime. Ne

Poznámka:

Verze 2.0 podporuje Azure Integration Runtime a vlastní hostovaný Integration Runtime verze 5.60 nebo vyšší. Instalace ovladače už není potřeba v místním prostředí Integration Runtime verze 5.60 nebo vyšší.

Příklad: verze 2.0

{
    "name": "AmazonRedshiftLinkedService",
    "properties":
    {
        "type": "AmazonRedshift",
        "version": "2.0",
        "typeProperties":
        {
            "server": "<server name>",
            "database": "<database name>",
            "username": "<username>",
            "password": {
                "type": "SecureString",
                "value": "<password>"
            }
        },
        "connectVia": {
            "referenceName": "<name of Integration Runtime>",
            "type": "IntegrationRuntimeReference"
        }
    }
}

Příklad: verze 1.0

{
    "name": "AmazonRedshiftLinkedService",
    "properties":
    {
        "type": "AmazonRedshift",
        "typeProperties":
        {
            "server": "<server name>",
            "database": "<database name>",
            "username": "<username>",
            "password": {
                "type": "SecureString",
                "value": "<password>"
            }
        },
        "connectVia": {
            "referenceName": "<name of Integration Runtime>",
            "type": "IntegrationRuntimeReference"
        }
    }
}

Vlastnosti datové sady

Úplný seznam oddílů a vlastností dostupných pro definování datových sad najdete v článku o datových sadách . Tato část obsahuje seznam vlastností podporovaných datovou sadou Amazon Redshift.

Pokud chcete kopírovat data z Amazon Redshiftu, podporují se následující vlastnosti:

Vlastnost Popis Požadováno
typ Vlastnost typu datové sady musí být nastavená na: AmazonRedshiftTable. Ano
schéma Název schématu Ne (pokud je zadán dotaz ve zdroji aktivity)
tabulka Název tabulky. Ne (pokud je zadán dotaz ve zdroji aktivity)
název tabulky Název tabulky se schématem Tato vlastnost je podporována pro zpětnou kompatibilitu. Používejte schema a table pro nové úlohy. Ne (pokud je zadán dotaz ve zdroji aktivity)

Příklad

{
    "name": "AmazonRedshiftDataset",
    "properties":
    {
        "type": "AmazonRedshiftTable",
        "typeProperties": {},
        "schema": [],
        "linkedServiceName": {
            "referenceName": "<Amazon Redshift linked service name>",
            "type": "LinkedServiceReference"
        }
    }
}

Pokud jste používali RelationalTable typově definovanou datovou sadu, je stále podporovaná tak, jak je, a doporučuje se použít novou datovou sadu.

Vlastnosti kopírovací aktivity

Úplný seznam oddílů a vlastností dostupných pro definování aktivit najdete v článku Pipelines . Tato část obsahuje seznam vlastností podporovaných zdrojem Amazon Redshift.

Amazon Redshift jako zdroj

Pokud chcete kopírovat data z Amazon Redshiftu, nastavte typ zdroje v aktivitě kopírování na AmazonRedshiftSource. V části source aktivity kopírování jsou podporovány následující vlastnosti:

Vlastnost Popis Požadováno
typ Vlastnost typu zdroje aktivity kopírování musí být nastavena na: AmazonRedshiftSource Ano
dotaz Ke čtení dat použijte vlastní dotaz. Například: vyberte * z tabulky MyTable. Ne (pokud je v datové sadě zadán název tabulky)
redshiftUnloadSettings Skupina vlastností při použití Amazon Redshift UNLOAD. Ne
s3PropojenáSlužbaNázev Odkazuje na Amazon S3 k použití jako dočasné úložiště zadáním názvu propojené služby typu AmazonS3. Ano, pokud používáte FUNKCI UNLOAD
název bucketu Označte kontejner S3 pro uložení dočasných dat. Pokud není k dispozici, služba ji automaticky vygeneruje. Ano, pokud používáte FUNKCI UNLOAD

Příklad: Zdroj Amazon Redshift v aktivitě kopírování pomocí FUNKCE UNLOAD

"source": {
    "type": "AmazonRedshiftSource",
    "query": "<SQL query>",
    "redshiftUnloadSettings": {
        "s3LinkedServiceName": {
            "referenceName": "<Amazon S3 linked service>",
            "type": "LinkedServiceReference"
        },
        "bucketName": "bucketForUnload"
    }
}

Přečtěte si další informace o tom, jak pomocí funkce UNLOAD efektivně kopírovat data z Amazon Redshiftu z další části.

Kopírování dat z Amazon Redshiftu pomocí funkce UNLOAD

UNLOAD je mechanismus, který poskytuje Amazon Redshift, který může uvolnit výsledky dotazu do jednoho nebo více souborů ve službě Amazon Simple Storage Service (Amazon S3). Je to způsob doporučovaný Amazonem pro kopírování velkých datových sad z Redshiftu.

Example: kopírování dat z Amazon Redshiftu do Azure Synapse Analytics pomocí UNLOAD, fázované kopie a PolyBase

U tohoto ukázkového případu použití aktivita kopírování uvolní data z Amazon Redshift do Amazon S3, jak je nakonfigurováno v "redshiftUnloadSettings", a pak zkopíruje data ze služby Amazon S3 do služby Azure Blob, jak je uvedeno v části "stagingSettings". Nakonec pomocí PolyBase načíst data do Azure Synapse Analytics. Veškeré dočasné formátování je správně zpracováno kopírovací operací.

Pracovní postup kopírování z Redshift do Azure Synapse Analytics

"activities":[
    {
        "name": "CopyFromAmazonRedshiftToSQLDW",
        "type": "Copy",
        "inputs": [
            {
                "referenceName": "AmazonRedshiftDataset",
                "type": "DatasetReference"
            }
        ],
        "outputs": [
            {
                "referenceName": "AzureSQLDWDataset",
                "type": "DatasetReference"
            }
        ],
        "typeProperties": {
            "source": {
                "type": "AmazonRedshiftSource",
                "query": "select * from MyTable",
                "redshiftUnloadSettings": {
                    "s3LinkedServiceName": {
                        "referenceName": "AmazonS3LinkedService",
                        "type": "LinkedServiceReference"
                    },
                    "bucketName": "bucketForUnload"
                }
            },
            "sink": {
                "type": "SqlDWSink",
                "allowPolyBase": true
            },
            "enableStaging": true,
            "stagingSettings": {
                "linkedServiceName": "AzureStorageLinkedService",
                "path": "adfstagingcopydata"
            },
            "dataIntegrationUnits": 32
        }
    }
]

Mapování datových typů pro Amazon Redshift

Při kopírování dat z Amazon Redshiftu platí následující mapování z datových typů Amazon Redshiftu na interní datové typy používané službou. Informace o tom, jak aktivita kopírování mapuje zdrojové schéma a datový typ na jímku, najdete v tématu Mapování schématu a datového typu.

Datový typ Amazon Redshift Dočasný datový typ služby (pro verzi 2.0) Dočasný datový typ služby (pro verzi 1.0)
BIGINT Int64 Int64
BOOLEOVSKÝ logický Řetězec
ZNAK Řetězec Řetězec
Datum Datum a čas Datum a čas
DECIMAL (přesnost <= 28) Desetinné číslo Desetinné číslo
DECIMAL (přesnost > 28) Řetězec Řetězec
DVOJITÁ PŘESNOST Hodnota s dvojitou přesností Hodnota s dvojitou přesností
CELÉ ČÍSLO Int32 Int32
SKUTEČNÝ Jednotný Jednotný
SMALLINT Int16 Int16
TEXT Řetězec Řetězec
ČASOVÉ RAZÍTKO Datum a čas Datum a čas
VARCHAR Řetězec Řetězec

Vlastnosti vyhledávací činnosti

Podrobnosti o vlastnostech najdete v aktivitě Vyhledávání.

Životní cyklus a aktualizace konektoru Amazon Redshift

Následující tabulka ukazuje fázi vydání a protokoly změn pro různé verze konektoru Amazon Redshift:

Verze Fáze vydání Záznam změn
Verze 1.0 Oznámení ukončení podpory /
Verze 2.0 Dostupná verze GA • Podporuje Azure Integration Runtime a místní Integration Runtime verze 5.60 nebo vyšší. Instalace ovladače už není potřeba v místním prostředí Integration Runtime verze 5.60 nebo vyšší.

• BoOLEAN se čte jako logický datový typ.

• Podpora sslmode v propojené službě.

Upgradovat konektor Amazon Redshift z verze 1.0 na verzi 2.0

  1. Na stránce Upravit propojenou službu vyberte verzi 2.0 a nakonfigurujte propojenou službu odkazem na vlastnosti propojené služby.

  2. Mapování datových typů pro propojenou službu Amazon Redshift verze 2.0 se liší od mapování datového typu pro propojenou službu Amazon Redshift verze 1.0. Informace o nejnovějším mapování datových typů najdete v tématu Mapování datových typů pro Amazon Redshift.

  3. Použijte místní prostředí Integration Runtime s verzí 5.60 nebo vyšší. Instalace ovladače už není potřeba v místním prostředí Integration Runtime verze 5.60 nebo vyšší.

Seznam úložišť dat, která jsou podporována jako zdroje a cíle aktivitou kopírování, najdete v kapitole podporovaná úložiště dat.