Copiare dati da Amazon S3 Compatible Archiviazione usando Azure Data Factory o Synapse Analytics

Articolo
11/16/2023

SI APPLICA A: Azure Data Factory Azure Synapse Analytics

Suggerimento

Provare Data Factory in Microsoft Fabric, una soluzione di analisi completa per le aziende. Microsoft Fabric copre tutti gli elementi, dallo spostamento dei dati all'analisi scientifica dei dati, all'analisi in tempo reale, alla business intelligence e alla creazione di report. Scopri come avviare gratuitamente una nuova versione di valutazione .

Questo articolo illustra come copiare dati da Amazon Simple Archiviazione Service (Amazon S3) Compatible Archiviazione. Per altre informazioni, vedere gli articoli introduttivi per Azure Data Factory e Synapse Analytics.

Funzionalità supportate

Questo connettore di Archiviazione compatibile con Amazon S3 è supportato per le funzionalità seguenti:

Funzionalità supportate	IR
attività Copy (source/-)	① ②
Attività Lookup	① ②
Attività GetMetadata	① ②
Attività Delete	① ②

(1) Runtime di integrazione di Azure (2) Runtime di integrazione self-hosted

In particolare, questo connettore compatibile con Amazon S3 Archiviazione supporta la copia dei file così come è o l'analisi dei file con i formati di file supportati e i codec di compressione. Il connettore usa AWS Signature Version 4 per autenticare le richieste a S3. È possibile usare questo connettore di Archiviazione compatibile con Amazon S3 per copiare i dati da qualsiasi provider di archiviazione compatibile con S3. Specificare l'URL del servizio corrispondente nella configurazione del servizio collegato.

Autorizzazioni necessarie

Per copiare dati da Amazon S3 Compatible Archiviazione, assicurarsi di avere ottenuto le autorizzazioni seguenti per le operazioni sugli oggetti Amazon S3: s3:GetObject e s3:GetObjectVersion.

Se si usa l'interfaccia utente per creare, sono necessarie autorizzazioni e s3:ListBucket/s3:GetBucketLocation aggiuntive s3:ListAllMyBuckets per operazioni come il test della connessione al servizio collegato e l'esplorazione dalla radice. Se non si vogliono concedere queste autorizzazioni, è possibile scegliere le opzioni "Test connessione al percorso del file" o "Sfoglia dal percorso specificato" dall'interfaccia utente.

Per l'elenco completo delle autorizzazioni di Amazon S3, vedere Specifica delle autorizzazioni in un criterio nel sito AWS.

Introduzione

Per eseguire l'attività di copia con una pipeline, è possibile usare uno degli strumenti o SDK seguenti:

Creare un servizio collegato a Amazon S3 Compatibile Archiviazione usando l'interfaccia utente

Seguire questa procedura per creare un servizio collegato a Amazon S3 Compatible Archiviazione nell'interfaccia utente di portale di Azure.

Passare alla scheda Gestisci nell'area di lavoro di Azure Data Factory o Synapse e selezionare Servizi collegati, quindi fare clic su Nuovo:
- Azure Data Factory
- Azure Synapse
Cercare Amazon e selezionare il connettore Amazon S3 Compatibile Archiviazione.
Configurare i dettagli del servizio, testare la connessione e creare il nuovo servizio collegato.

Dettagli di configurazione di Connessione or

Le sezioni seguenti forniscono informazioni dettagliate sulle proprietà usate per definire entità specifiche per Amazon S3 Compatible Archiviazione.

Proprietà del servizio collegato

Per un servizio collegato compatibile con Amazon S3 sono supportate le proprietà seguenti:

Proprietà	Descrizione	Richiesto
Tipo	La proprietà type deve essere impostata su AmazonS3Compatible.	Sì
accessKeyId	ID della chiave di accesso segreta.	Sì
secretAccessKey	La stessa chiave di accesso segreta. Contrassegnare questo campo come SecureString per archiviarlo in modo sicuro o fare riferimento a un segreto archiviato in Azure Key Vault.	Sì
serviceUrl	Specificare l'endpoint `https://<service url>`S3 personalizzato.	No
forcePathStyle	Indica se usare l'accesso in stile percorso S3 anziché l'accesso in stile ospitato virtuale. I valori consentiti sono: false (impostazione predefinita), true. Controllare la documentazione di ogni archivio dati se è necessario o meno l'accesso in stile percorso.	No
connectVia	Runtime di integrazione da usare per la connessione all'archivio dati. È possibile usare il runtime di integrazione di Azure o il runtime di integrazione self-hosted (se l'archivio dati si trova in una rete privata). Se questa proprietà non è specificata, il servizio usa il runtime di integrazione di Azure predefinito.	No

Esempio:

{
    "name": "AmazonS3CompatibleLinkedService",
    "properties": {
        "type": "AmazonS3Compatible",
        "typeProperties": {
            "accessKeyId": "<access key id>",
            "secretAccessKey": {
                "type": "SecureString",
                "value": "<secret access key>"
            }
        },
        "connectVia": {
            "referenceName": "<name of Integration Runtime>",
            "type": "IntegrationRuntimeReference"
        }
    }
}

Proprietà del set di dati

Per un elenco completo delle sezioni e delle proprietà disponibili per la definizione dei set di dati, vedere l'articolo Set di dati.

Azure Data Factory supporta i formati di file seguenti. Per impostazioni basate sui formati, fare riferimento ai singoli articoli.

Le proprietà seguenti sono supportate per Amazon S3 Compatible in location impostazioni in un set di dati basato sul formato:

Proprietà	Descrizione	Richiesto
Tipo	La proprietà type in `location` in un set di dati deve essere impostata su AmazonS3CompatibleLocation.	Sì
bucketName	Nome Archiviazione bucket compatibile con S3.	Sì
folderPath	Percorso della cartella nel bucket specificato. Se si vuole usare un carattere jolly per filtrare la cartella, ignorare questa impostazione e specificare che nelle impostazioni dell'origine attività.	No
fileName	Nome del file nel bucket e nel percorso della cartella specificati. Se si vuole usare un carattere jolly per filtrare i file, ignorare questa impostazione e specificare che nelle impostazioni dell'origine dell'attività.	No
versione	Versione dell'oggetto Archiviazione compatibile S3, se è abilitato il controllo delle versioni di S3 Compatible Archiviazione. Se non è specificato, verrà recuperata la versione più recente.	No

Esempio:

{
    "name": "DelimitedTextDataset",
    "properties": {
        "type": "DelimitedText",
        "linkedServiceName": {
            "referenceName": "<Amazon S3 Compatible Storage linked service name>",
            "type": "LinkedServiceReference"
        },
        "schema": [ < physical schema, optional, auto retrieved during authoring > ],
        "typeProperties": {
            "location": {
                "type": "AmazonS3CompatibleLocation",
                "bucketName": "bucketname",
                "folderPath": "folder/subfolder"
            },
            "columnDelimiter": ",",
            "quoteChar": "\"",
            "firstRowAsHeader": true,
            "compressionCodec": "gzip"
        }
    }
}

Proprietà dell'attività di copia

Per un elenco completo delle sezioni e delle proprietà disponibili per la definizione delle attività, vedere l'articolo sulle pipeline. Questa sezione fornisce un elenco delle proprietà supportate dall'origine compatibile con Amazon S3 Archiviazione.

Amazon S3 Compatible Archiviazione as a source type (Archiviazione compatibile con Amazon S3 come tipo di origine)

Azure Data Factory supporta i formati di file seguenti. Per impostazioni basate sui formati, fare riferimento ai singoli articoli.

Le proprietà seguenti sono supportate per i Archiviazione storeSettings compatibili con Amazon S3 nelle impostazioni in un'origine di copia basata su formato:

Proprietà	Descrizione	Richiesto
Tipo	La proprietà type in `storeSettings` deve essere impostata su AmazonS3CompatibleRead Impostazioni.	Sì
Individuare i file da copiare:
OPZIONE 1: percorso statico	Copia dal percorso del bucket o della cartella/file specificato nel set di dati. Se si desidera copiare tutti i file da un bucket o una cartella, specificare `wildcardFileName` anche come `*`.
OPZIONE 2: Prefisso Archiviazione compatibile con S3 - prefisso	Prefisso per il nome della chiave Archiviazione compatibile S3 nel bucket specificato configurato in un set di dati per filtrare i file di Archiviazione compatibili con S3 di origine. S3 Chiavi compatibili Archiviazione i cui nomi iniziano con `bucket_in_dataset/this_prefix` sono selezionati. Usa il filtro lato servizio di S3 Compatibile Archiviazione, che offre prestazioni migliori rispetto a un filtro con caratteri jolly. Quando si usa il prefisso e si sceglie di copiare nel sink basato su file con conservazione della gerarchia, si noti che il sottopercorso dopo l'ultimo "/" nel prefisso verrà mantenuto. Ad esempio, si dispone di origine `bucket/folder/subfolder/file.txt`e si configura il prefisso come `folder/sub`, quindi il percorso del file conservato è `subfolder/file.txt`.	No
OPZIONE 3: carattere jolly - wildcardFolderPath	Percorso della cartella con caratteri jolly nel bucket specificato configurato in un set di dati per filtrare le cartelle di origine. I caratteri jolly consentiti sono: `*` (corrispondenza di zero o più caratteri) e `?` (corrispondenza di zero caratteri o di un carattere singolo). Usare `^` per eseguire l'escape se il nome della cartella ha un carattere jolly o questo carattere di escape all'interno. Vedere altri esempi in Esempi di filtro file e cartelle.	No
OPZIONE 3: carattere jolly - wildcardFileName	Nome file con caratteri jolly nel bucket e nel percorso della cartella specificato (o percorso della cartella con caratteri jolly) per filtrare i file di origine. I caratteri jolly consentiti sono: `*` (corrispondenza di zero o più caratteri) e `?` (corrispondenza di zero caratteri o di un carattere singolo). Usare `^` per eseguire l'escape se il nome del file ha un carattere jolly o questo carattere di escape all'interno. Vedere altri esempi in Esempi di filtro file e cartelle.	Sì
OPZIONE 4: un elenco di file - fileListPath	Indica di copiare un determinato set di file. Puntare a un file di testo che include un elenco di file da copiare, un file per riga, ovvero il percorso relativo al percorso configurato nel set di dati. Quando si usa questa opzione, non specificare un nome file nel set di dati. Per altri esempi, vedere Esempi di elenco di file.	No
Impostazioni aggiuntive:
recursive	Indica se i dati vengono letti in modo ricorsivo dalle cartelle secondarie o solo dalla cartella specificata. Si noti che quando la ricorsiva è impostata su true e il sink è un archivio basato su file, una cartella o una sottocartella vuota non viene copiata o creata nel sink. I valori consentiti sono true (predefinito) e false. Questa proprietà non è applicabile quando si configura `fileListPath`.	No
deleteFilesAfterCompletion	Indica se i file binari verranno eliminati dall'archivio di origine dopo il corretto spostamento nell'archivio di destinazione. L'eliminazione del file è per file, quindi quando l'attività di copia ha esito negativo, si noterà che alcuni file sono già stati copiati nella destinazione ed eliminati dall'origine, mentre altri rimangono nell'archivio di origine. Questa proprietà è valida solo nello scenario di copia dei file binari. Valore predefinito: false.	No
modifiedDatetimeStart	I file vengono filtrati in base all'attributo: ultima modifica. I file verranno selezionati se l'ora dell'ultima modifica è maggiore o uguale a `modifiedDatetimeStart` e minore di `modifiedDatetimeEnd`. L'ora viene applicata a un fuso orario UTC nel formato "2018-12-01T05:00:00Z". Le proprietà possono essere NULL, il che significa che al set di dati non verrà applicato alcun filtro di attributo di file. Quando `modifiedDatetimeStart` ha un valore datetime ma `modifiedDatetimeEnd` è NULL, verranno selezionati i file il cui ultimo attributo modificato è maggiore o uguale al valore datetime. Quando `modifiedDatetimeEnd` ha un valore datetime ma `modifiedDatetimeStart` è NULL, verranno selezionati i file il cui ultimo attributo modificato è minore del valore datetime. Questa proprietà non è applicabile quando si configura `fileListPath`.	No
modifiedDatetimeEnd	Come sopra.	No
enablePartitionDiscovery	Per i file partizionati, specificare se analizzare le partizioni dal percorso del file e aggiungerle come colonne di origine aggiuntive. I valori consentiti sono false (impostazione predefinita) e true.	No
partitionRootPath	Quando l'individuazione delle partizioni è abilitata, specificare il percorso radice assoluto per leggere le cartelle partizionate come colonne di dati. Se non è specificato, per impostazione predefinita, - Quando si usa il percorso del file nel set di dati o nell'elenco di file nell'origine, il percorso radice della partizione è il percorso configurato nel set di dati. - Quando si usa il filtro delle cartelle con caratteri jolly, il percorso radice della partizione è il sottopercorso prima del primo carattere jolly. - Quando si usa il prefisso, il percorso radice della partizione è sottopercorso prima dell'ultimo "/". Si supponga, ad esempio, di configurare il percorso nel set di dati come "root/folder/year=2020/month=08/day=27": - Se si specifica il percorso radice della partizione come "root/folder/year=2020", l'attività di copia genererà altre due colonne `month` e `day` con il valore "08" e "27" rispettivamente, oltre alle colonne all'interno dei file. - Se il percorso radice della partizione non è specificato, non verrà generata alcuna colonna aggiuntiva.	No
maxConcurrentConnections	Limite massimo di connessioni simultanee stabilite all'archivio dati durante l'esecuzione dell'attività. Specificare un valore solo quando si desidera limitare le connessioni simultanee.	No

Esempio:

"activities":[
    {
        "name": "CopyFromAmazonS3CompatibleStorage",
        "type": "Copy",
        "inputs": [
            {
                "referenceName": "<Delimited text input dataset name>",
                "type": "DatasetReference"
            }
        ],
        "outputs": [
            {
                "referenceName": "<output dataset name>",
                "type": "DatasetReference"
            }
        ],
        "typeProperties": {
            "source": {
                "type": "DelimitedTextSource",
                "formatSettings":{
                    "type": "DelimitedTextReadSettings",
                    "skipLineCount": 10
                },
                "storeSettings":{
                    "type": "AmazonS3CompatibleReadSettings",
                    "recursive": true,
                    "wildcardFolderPath": "myfolder*A",
                    "wildcardFileName": "*.csv"
                }
            },
            "sink": {
                "type": "<sink type>"
            }
        }
    }
]

Esempi di filtro file e cartelle

Questa sezione descrive il comportamento risultante del percorso cartella e del nome del file con i filtri con caratteri jolly.

bucket	key	recursive	Struttura delle cartelle di origine e risultato del filtro (i file in grassetto sono stati recuperati)
bucket	`Folder/`	falso	bucket CartellaA File1.csv File2.json Sottocartella1 File3.csv File4.json File5.csv AltraCartellaB File6.csv
bucket	`Folder/`	true	bucket CartellaA File1.csv File2.json Sottocartella1 File3.csv File4.json File5.csv AltraCartellaB File6.csv
bucket	`Folder/.csv`	falso	bucket CartellaA File1.csv File2.json Sottocartella1 File3.csv File4.json File5.csv AltraCartellaB File6.csv
bucket	`Folder/.csv`	true	bucket CartellaA File1.csv File2.json Sottocartella1 File3.csv File4.json File5.csv AltraCartellaB File6.csv

Esempi di elenco di file

Questa sezione descrive il comportamento risultante dell'uso di un percorso di elenco di file in un'origine attività Copy.

Si supponga di avere la struttura di cartelle di origine seguente e di voler copiare i file in grassetto:

Esempio di struttura di origine	Contenuto in FileListToCopy.txt	Configurazione
bucket CartellaA File1.csv File2.json Sottocartella1 File3.csv File4.json File5.csv Metadati UFX FileListToCopy.txt	File1.csv Sottocartella1/File3.csv Sottocartella1/File5.csv	Nel set di dati: - Bucket: `bucket` - Percorso cartella: `FolderA` Nell'origine attività Copy: - Percorso elenco file: `bucket/Metadata/FileListToCopy.txt` Il percorso dell'elenco di file punta a un file di testo nello stesso archivio dati che include un elenco di file da copiare, un file per riga, con il percorso relativo al percorso configurato nel set di dati.

Proprietà dell'attività Lookup

Per altre informazioni sulle proprietà, vedere Attività Lookup.

Proprietà dell'attività GetMetadata

Per informazioni dettagliate sulle proprietà, vedere l'attività GetMetadata.

Proprietà dell'attività Delete

Per informazioni dettagliate sulle proprietà, selezionare Elimina attività.

Per un elenco di archivi dati supportati dal attività Copy come origini e sink, vedere Archivi dati supportati.

Condividi tramite

Copiare dati da Amazon S3 Compatible Archiviazione usando Azure Data Factory o Synapse Analytics

Funzionalità supportate

Autorizzazioni necessarie

Introduzione

Creare un servizio collegato a Amazon S3 Compatibile Archiviazione usando l'interfaccia utente

Dettagli di configurazione di Connessione or

Proprietà del servizio collegato

Proprietà del set di dati

Proprietà dell'attività di copia

Amazon S3 Compatible Archiviazione as a source type (Archiviazione compatibile con Amazon S3 come tipo di origine)

Esempi di filtro file e cartelle

Esempi di elenco di file

Proprietà dell'attività Lookup

Proprietà dell'attività GetMetadata

Proprietà dell'attività Delete

Commenti e suggerimenti

Risorse aggiuntive

Condividi tramite

Copiare dati da Amazon S3 Compatible Archiviazione usando Azure Data Factory o Synapse Analytics

Funzionalità supportate

Autorizzazioni necessarie

Introduzione

Creare un servizio collegato a Amazon S3 Compatibile Archiviazione usando l'interfaccia utente

Dettagli di configurazione di Connessione or

Proprietà del servizio collegato

Proprietà del set di dati

Proprietà dell'attività di copia

Amazon S3 Compatible Archiviazione as a source type (Archiviazione compatibile con Amazon S3 come tipo di origine)

Esempi di filtro file e cartelle

Esempi di elenco di file

Proprietà dell'attività Lookup

Proprietà dell'attività GetMetadata

Proprietà dell'attività Delete

Contenuto correlato

Commenti e suggerimenti

Risorse aggiuntive