Kopírování dat z Netezza pomocí Azure Data Factory nebo Synapse Analytics

VZTAHUJE SE NA: Azure Data Factory Azure Synapse Analytics

Tip

Data Factory v Microsoft Fabric je nová generace Azure Data Factory s jednodušší architekturou, integrovanou AI a novými funkcemi. Pokud s integrací dat začínáte, začněte Fabric Data Factory. Stávající úlohy ADF lze upgradovat na Fabric pro přístup k novým funkcím v oblastech datové vědy, analýz v reálném čase a vytváření sestav.

Tento článek popisuje, jak kopírovat data z Netezza pomocí aktivity kopírování v datových kanálech Azure Data Factory nebo Synapse Analytics. Článek vychází z Copy Activity, která představuje obecný přehled Copy Activity.

Tip

V případě scénáře migrace dat z Netezza do Azure si přečtěte další informace z Migrace dat z místního serveru Netezza do Azure.

Important

Konektor Netezza verze 1.0 je ve fázi odebrání. Doporučujeme upgradovat konektor Netezza z verze 1.0 na verzi 2.0.

Podporované funkce

Tento konektor Netezza je podporovaný pro následující funkce:

Podporované funkce IR
aktivita Copy (zdroj/-) (1) (pouze pro verzi 1.0) (2)
Vyhledávací aktivita (1) (pouze pro verzi 1.0) (2)

(1) Azure Integration Runtime (2) Lokálně hostované Integration Runtime

Seznam úložišť dat, která aktivita kopírování podporuje jako zdroje a jímky, najdete v tématu Podporované úložiště a formáty dat.

Tento konektor Netezza podporuje:

Služba poskytuje integrovaný ovladač, který umožňuje připojení. Abyste mohli tento konektor používat, nemusíte ručně instalovat žádný ovladač.

Pro verzi 2.0 je nutné nainstalovat ovladač ODBC IBM Netezza ručně. Pro verzi 1.0 poskytuje služba integrovaný ovladač, který umožňuje připojení. Abyste mohli tento konektor používat, nemusíte ručně instalovat žádný ovladač.

Prerequisites

Pokud se vaše úložiště dat nachází uvnitř místní sítě, Azure virtuální sítě, nebo Amazon Virtual Private Cloud, musíte pro připojení nakonfigurovat self-hosted Integration Runtime.

Další informace o mechanismech zabezpečení sítě a možnostech podporovaných službou Data Factory najdete v tématu Strategie přístupu k datům.

Pro verzi 1.0

Pokud je vaše úložiště dat spravovanou cloudovou datovou službou, můžete použít Azure Integration Runtime. Pokud je přístup omezený na IP adresy schválené v pravidlech brány firewall, můžete do seznamu povolených přidat ip adresy Azure Integration Runtime.

Funkci managed virtual network Integration Runtime můžete také použít v Azure Data Factory pro přístup k místní síti bez nutnosti instalace a konfigurace místního prostředí Integration Runtime.

Instalace ovladače Netezza ODBC pro verzi 2.0

Pokud chcete používat konektor Netezza s verzí 2.0, nainstalujte na počítač, na kterém běží místní prostředí Integration Runtime, ovladač ODBC IBM Netezza verze 11.02.02 nebo vyšší.

Začínáme

Kanál, který používá aktivitu kopírování, můžete vytvořit pomocí sady .NET SDK, sady Python SDK, Azure PowerShell, rozhraní REST API nebo šablony Azure Resource Manager. Podrobné pokyny k vytvoření kanálu s aktivitou kopírování najdete v kurzuaktivita kopírování.

Vytvoření propojené služby do Netezza pomocí uživatelského rozhraní

Pomocí následujícího postupu vytvořte propojenou službu s Netezza v uživatelském rozhraní portálu Azure.

  1. Přejděte na kartu Spravovat v pracovním prostoru Azure Data Factory nebo Synapse a vyberte Propojené služby a potom klikněte na Nový:

  2. Vyhledejte Netezza a vyberte konektor Netezza.

    Snímek obrazovky s konektorem Netezza

  3. Nakonfigurujte podrobnosti o službě, otestujte připojení a vytvořte novou propojenou službu.

    Snímek obrazovky s konfigurací propojené služby pro Netezza

Podrobnosti konfigurace konektoru

Následující části obsahují podrobnosti o vlastnostech, které můžete použít k definování entit specifických pro konektor Netezza.

Vlastnosti propojené služby

Konektor Netezza teď podporuje verzi 2.0. V této části najdete informace o upgradu verze konektoru Netezza z verze 1.0. Podrobnosti o nemovitosti najdete v odpovídajících oddílech.

Verze 2.0

Propojená služba Netezza podporuje následující vlastnosti při použití verze 2.0:

Property Description Required
typ Vlastnost typu musí být nastavena na Netezza. Yes
verze Zadaná verze. Hodnota je 2.0. Yes
server Název hostitele nebo IP adresa serveru Netezza. Yes
port Číslo portu serverového naslouchání. Yes
databáze Název databáze Netezza. Yes
uid ID uživatele použité k připojení k databázi. Yes
pwd Heslo použité pro připojení k databázi. Yes
SecurityLevel Úroveň zabezpečení, kterou ovladač používá pro připojení k úložišti dat.
Příklad: SecurityLevel=preferredUnSecured. Podporované hodnoty jsou:
- Pouze nezabezpečený (onlyUnSecured): Ovladač nepoužívá protokol SSL.
- Preferovaný nezabezpečený (preferredUnSecured) (výchozí): Pokud server nabízí volbu, ovladač nepoužívá protokol SSL.
No
connectVia Integration Runtime použít pro připojení k úložišti dat. Další informace najdete v části Požadavky . Můžete použít pouze místní prostředí Integration Runtime. No

Example

{
    "name": "NetezzaLinkedService",
    "properties": {
        "type": "Netezza",
        "version": "2.0",
        "typeProperties": {
            "server": "<server>",
	        "port": "<port>",
            "database": "<database>",
 		    "uid": "<username>",
		    "pwd": {
                "type": "SecureString",
                "value": "<password>"
             },
		    "securityLevel": "preferredUnSecured"
        },
        "connectVia": {
            "referenceName": "<name of Integration Runtime>",
            "type": "IntegrationRuntimeReference"
        }
    }
}

Verze 1.0

Při použití verze 1.0 jsou pro propojenou službu Netezza podporovány následující vlastnosti:

Property Description Required
typ Vlastnost typu musí být nastavena na Netezza. Yes
connectionString Připojovací řetězec ODBC pro připojení k Netezza.
Můžete také vložit heslo do Azure Key Vault a oddělit konfiguraci pwd z připojovacího řetězce. Podrobnosti naleznete v následujících ukázkách a v článku o uložení přihlašovacích údajů do Azure Key Vault.
Yes
connectVia Integration Runtime použít pro připojení k úložišti dat. Další informace najdete v části Požadavky . Pokud není zadaný, použije se výchozí Azure Integration Runtime. No

Typický připojovací řetězec je Server=<server>;Port=<port>;Database=<database>;UID=<user name>;PWD=<password>. Následující tabulka popisuje další vlastnosti, které můžete nastavit:

Property Description Required
SecurityLevel Úroveň zabezpečení, kterou ovladač používá pro připojení k úložišti dat.
Příklad: SecurityLevel=preferredUnSecured. Podporované hodnoty jsou:
- Pouze nezabezpečený (onlyUnSecured): Ovladač nepoužívá protokol SSL.
- Preferovaný nezabezpečený (preferredUnSecured) (výchozí): Pokud server nabízí volbu, ovladač nepoužívá protokol SSL.
No

Note

Konektor nepodporuje SSLv3, protože byl oficiálně zrušený společností Netezza.

Example

{
    "name": "NetezzaLinkedService",
    "properties": {
        "type": "Netezza",
        "typeProperties": {
            "connectionString": "Server=<server>;Port=<port>;Database=<database>;UID=<user name>;PWD=<password>"
        },
        "connectVia": {
            "referenceName": "<name of Integration Runtime>",
            "type": "IntegrationRuntimeReference"
        }
    }
}

Example: uložení hesla do Azure Key Vault

{
    "name": "NetezzaLinkedService",
    "properties": {
        "type": "Netezza",
        "typeProperties": {
            "connectionString": "Server=<server>;Port=<port>;Database=<database>;UID=<user name>;",
            "pwd": { 
                "type": "AzureKeyVaultSecret", 
                "store": { 
                    "referenceName": "<Azure Key Vault linked service name>", 
                    "type": "LinkedServiceReference" 
                }, 
                "secretName": "<secretName>" 
            }
        },
        "connectVia": {
            "referenceName": "<name of Integration Runtime>",
            "type": "IntegrationRuntimeReference"
        }
    }
}

Vlastnosti datové sady

Tato část obsahuje seznam vlastností, které datová sada Netezza podporuje.

Úplný seznam oddílů a vlastností, které jsou k dispozici pro definování datových sad, najdete v tématu Datové sady.

Pokud chcete kopírovat data z Netezza, nastavte vlastnost typu datové sady na NetezzaTable. Podporují se následující vlastnosti:

Property Description Required
typ Vlastnost typu datové sady musí být nastavená na: NetezzaTable. Yes
schéma Název schématu Ne (pokud je zadán dotaz ve zdroji aktivity)
tabulka Název tabulky. Ne (pokud je zadán dotaz ve zdroji aktivity)
tableName Název tabulky se schématem Tato vlastnost je podporována pro zpětnou kompatibilitu. Používejte schema a table pro nové úlohy. Ne (pokud je zadán dotaz ve zdroji aktivity)

Example

{
    "name": "NetezzaDataset",
    "properties": {
        "type": "NetezzaTable",
        "linkedServiceName": {
            "referenceName": "<Netezza linked service name>",
            "type": "LinkedServiceReference"
        },
        "typeProperties": {}
    }
}

Vlastnosti aktivity kopírování

Tato část obsahuje seznam vlastností, které zdroj Netezza podporuje.

Úplný seznam oddílů a vlastností dostupných pro definování aktivit najdete v tématu Pipelines.

Netezza jako zdroj

Tip

Pokud chcete efektivně načítat data z Netezza pomocí dělení dat, přečtěte si další informace z oddílu Paralelní kopírování z oddílu Netezza .

Pokud chcete kopírovat data z Netezza, nastavte typ zdroje v aktivitě kopírování na NetezzaSource. V sekci zdroje aktivity kopírování jsou podporovány následující vlastnosti:

Property Description Required
typ Vlastnost typu zdroje aktivity kopírování musí být nastavena na NetezzaSource. Yes
dotaz Ke čtení dat použijte vlastní dotaz SQL. Příklad: "SELECT * FROM MyTable" Ne (pokud je v datové sadě zadán název tabulky)
partitionOptions Určuje možnosti dělení dat, které se používají k načtení dat z Netezza.
Povolené hodnoty jsou: None (výchozí), DataSlice a DynamicRange.
Pokud je aktivována možnost rozdělení (to znamená, že ne None), stupeň paralelismu pro souběžné načítání dat z databáze Netezza je kontrolován nastavením parallelCopies v aktivitě kopírování.
No
partitionSettings Zadejte skupinu nastavení pro dělení dat.
Použít, pokud není možnost diskového oddílu None.
No
partitionColumnName Zadejte název zdrojového sloupce v celočíselném typu , který bude použit dělením rozsahu pro paralelní kopírování. Pokud není specifikován, primární klíč tabulky je automaticky detekován a použit jako sloupec pro rozdělení.
Použít, pokud je možnost oddílu DynamicRange. Pokud k načtení zdrojových dat použijete dotaz, vložte ?AdfRangePartitionColumnName do klauzule WHERE. Podívejte se na příklad v části Paralelní kopie z Netezza.
No
partitionUpperBound Maximální hodnota sloupce oddílu pro zkopírování dat.
Použít, pokud je možnost oddílu DynamicRange. Při načítání zdrojových dat pomocí dotazu, zapojte ?AdfRangePartitionUpbound do klauzule WHERE. Viz část Paralelní kopie z Netezza pro příklad.
No
partitionLowerBound Minimální hodnota sloupce oddílu pro zkopírování dat.
Použít, pokud je možnost oddílu DynamicRange. Pokud k načtení zdrojových dat použijete dotaz, začněte s ?AdfRangePartitionLowbound v klauzuli WHERE. Viz část Paralelní kopie z Netezza pro příklad.
No

Example:

"activities":[
    {
        "name": "CopyFromNetezza",
        "type": "Copy",
        "inputs": [
            {
                "referenceName": "<Netezza input dataset name>",
                "type": "DatasetReference"
            }
        ],
        "outputs": [
            {
                "referenceName": "<output dataset name>",
                "type": "DatasetReference"
            }
        ],
        "typeProperties": {
            "source": {
                "type": "NetezzaSource",
                "query": "SELECT * FROM MyTable"
            },
            "sink": {
                "type": "<sink type>"
            }
        }
    }
]

Paralelní kopírování z Netezza

Konektor Data Factory Netezza poskytuje integrované dělení dat pro paralelní kopírování dat z Netezza. Možnosti dělení dat najdete v tabulce Zdroj aktivity kopírování.

Snímek obrazovky s možnostmi oddílu

Když povolíte dělenou kopii, služba spustí paralelní dotazy na zdroj Netezza, aby načetla data podle oddílů. Paralelní stupeň se řídí nastavením aktivity kopírování parallelCopies. Pokud například nastavíte parallelCopies hodnotu čtyři, služba souběžně vygeneruje a spouští čtyři dotazy na základě zadané možnosti a nastavení oddílu a každý dotaz načte část dat z databáze Netezza.

Doporučujeme povolit paralelní kopírování s dělením dat, zejména pokud načítáte velké množství dat z databáze Netezza. Následující konfigurace jsou navržené pro různé scénáře. Při kopírování dat do souborového úložiště dat se doporučuje zapisovat do složky jako více souborů (zadat pouze název složky), v takovém případě je výkon lepší než zápis do jednoho souboru.

Scenario Navrhovaná nastavení
Úplné načtení z velké tabulky Možnost oddílu: Řez dat

Během provádění služba automaticky rozdělí data na základě vestavěných datových řezů Netezza a kopíruje data podle particí.
Načtěte velké množství dat pomocí vlastního dotazu. Možnost oddílu: Řez dat
Dotaz: SELECT * FROM <TABLENAME> WHERE mod(datasliceid, ?AdfPartitionCount) = ?AdfDataSliceCondition AND <your_additional_where_clause>.
Během provádění služba nahrazuje ?AdfPartitionCount (s paralelním číslem kopírování nastaveným na aktivitě kopírování) a ?AdfDataSliceCondition logikou rozdělení datového bloku a odesílá je do Netezza.
Načtěte velké množství dat pomocí vlastního dotazu, který má celočíselný sloupec s rovnoměrně distribuovanými hodnotami pro rozdělení rozsahu. Možnosti oddílu: Dynamický rozsah oddílu
Dotaz: SELECT * FROM <TABLENAME> WHERE ?AdfRangePartitionColumnName <= ?AdfRangePartitionUpbound AND ?AdfRangePartitionColumnName >= ?AdfRangePartitionLowbound AND <your_additional_where_clause>.
Sloupec pro rozdělení: Zadejte sloupec použitý k rozdělení dat. Můžete provést rozdělení podle sloupce s celočíselným datovým typem.
Horní mez oddílu a dolní mez oddílu: Určete, jestli chcete filtrovat podle sloupce oddílu, aby se načítala data pouze mezi dolním a horním rozsahem.

Během provádění služba nahradí ?AdfRangePartitionColumnNamea ?AdfRangePartitionUpboundza skutečný název sloupce a ?AdfRangePartitionLowbound rozsahy hodnot pro každý oddíl a odešle do Netezza.
Pokud je například sloupec "ID" oddílu nastaven s dolní hranicí 1 a horní hranicí 80 a paralelní kopírování je nastaveno na 4, služba načte data ve čtyřech oddílech. Jejich ID jsou mezi [1,20], [21, 40], [41, 60] a [61, 80], v uvedeném pořadí.

Příklad: Dotaz s oddílem datového výřezu

"source": {
    "type": "NetezzaSource",
    "query": "SELECT * FROM <TABLENAME> WHERE mod(datasliceid, ?AdfPartitionCount) = ?AdfDataSliceCondition AND <your_additional_where_clause>",
    "partitionOption": "DataSlice"
}

Příklad: Dotaz s particí dynamického rozsahu

"source": {
    "type": "NetezzaSource",
    "query": "SELECT * FROM <TABLENAME> WHERE ?AdfRangePartitionColumnName <= ?AdfRangePartitionUpbound AND ?AdfRangePartitionColumnName >= ?AdfRangePartitionLowbound AND <your_additional_where_clause>",
    "partitionOption": "DynamicRange",
    "partitionSettings": {
        "partitionColumnName": "<dynamic_range_partition_column_name>",
        "partitionUpperBound": "<upper_value_of_partition_column>",
        "partitionLowerBound": "<lower_value_of_partition_column>"
    }
}

Mapování datových typů pro Netezza

Při kopírování dat z Netezza platí následující mapování z datových typů Netezza na interní datové typy používané službou. Informace o tom, jak aktivita kopírování mapuje zdrojové schéma a datový typ na jímku, najdete v tématu Mapování schématu a datového typu.

Datový typ Netezza Dočasný datový typ služby (pro verzi 2.0) Dočasný datový typ služby (pro verzi 1.0)
BOOLEAN logický logický
CHAR String String
VARCHAR String String
NCHAR String String
NVARCHAR String String
DATE Date DateTime
TIMESTAMP DateTime DateTime
TIME Time TimeSpan
INTERVAL Nepodporováno TimeSpan
ČAS S ČASOVÝM PÁSMEM String String
NUMERIC(p,s) Decimal Decimal
REAL Single Single
DVOJITÁ PŘESNOST Double Double
INTEGER Int32 Int32
BYTEINT Int16 SByte
SMALLINT Int16 Int16
BIGINT Int64 Int64

Vlastnosti aktivity vyhledávání

Zjistit podrobnosti o vlastnostech můžete v aktivitě Vyhledávání.

Životní cyklus konektoru Netezza a upgrade

Následující tabulka ukazuje fázi vydání a protokoly změn pro různé verze konektoru Netezza:

Version Fáze vydání Záznam změn
Verze 1.0 Removed Nelze použít.
Verze 2.0 Dostupná verze GA • Podporuje pouze místní prostředí Integration Runtime.

• BYTEINT se čte jako datový typ Int16.

• Datum se čte jako datový typ Date.

• TIME se čte jako datový typ Čas.

• INTERVAL není podporován.

Aktualizujte konektor Netezza z verze 1.0 na verzi 2.0

  1. Na stránce Upravit propojenou službu vyberte verzi 2.0. Další informace najdete ve vlastnostech propojené služby verze 2.0.
  2. Mapování datových typů propojené služby Netezza verze 2.0 se liší od mapování datového typu pro verzi 1.0. Nejnovější mapování datových typů najdete v tématu Mapování datových typů pro Netezza.
  3. Podporuje pouze místní prostředí Integration Runtime. Azure Integration Runtime verze 2.0 nepodporuje.

Seznam úložišť dat, která aktivita kopírování podporuje jako zdroje a jímky, najdete v tématu Podporované úložiště a formáty dat.