Copiar dados de ou para os Arquivos do Azure usando o Azure Data Factory

Artigo
09/13/2024

APLICA-SE A: Azure Data Factory Azure Synapse Analytics

Dica

Experimente o Data Factory no Microsoft Fabric, uma solução de análise tudo-em-um para empresas. O Microsoft Fabric abrange desde movimentação de dados até ciência de dados, análise em tempo real, business intelligence e relatórios. Saiba como iniciar uma avaliação gratuita!

Este artigo descreve como copiar dados de e para os Arquivos do Azure. Para saber mais sobre o Azure Data Factory, leia as artigo introdutório.

Funcionalidades com suporte

O conector dos Arquivos do Azure é compatível com as seguintes funcionalidades:

Funcionalidades com suporte	IR	Ponto de extremidade privado gerenciado
Atividade de cópia (origem/coletor)	① ②	✓ Excluir a conta de armazenamento V1
Atividade de pesquisa	① ②	✓ Excluir a conta de armazenamento V1
Atividade GetMetadata	① ②	✓ Excluir a conta de armazenamento V1
Excluir atividade	① ②	✓ Excluir a conta de armazenamento V1

① Runtime de integração do Azure ② Runtime de integração auto-hospedada

Você pode copiar os dados dos Arquivos do Azure para qualquer armazenamento de dados de origem com suporte, ou copiar os dados de qualquer armazenamento de dados de origem com suporte para os Arquivos do Azure. Para obter uma lista de armazenamentos de dados que o Copy Activity suporta como fontes e coletores, consulte Armazenamentos de dados e formatos compatíveis.

Especificamente, este conector dos Arquivos do Azure dá suporte a:

Copiar arquivos usando autenticações SAS (assinatura de acesso compartilhado) de serviço ou chave de conta.
Cópia de arquivos no estado em que se encontram ou análise/geração de arquivos com os formatos de arquivo e codecs de compactação com suporte.

Introdução

Para executar a atividade de Cópia com um pipeline, será possível usar as ferramentas ou os SDKs abaixo:

Criar um serviço vinculado para os Arquivos do Azure usando a interface do usuário

Use as etapas a seguir para criar um serviço vinculado aos Arquivos do Azure na interface do usuário do portal do Azure.

Navegue até a guia Gerenciar em seu espaço de trabalho do Azure Data Factory ou do Synapse, selecione Serviços Vinculados e clique em Novo:
- Azure Data Factory
- Azure Synapse
Pesquise o arquivo e selecione o conector para os Arquivos do Azure rotulado como Armazenamento de Arquivos do Azure.
Configure os detalhes do serviço, teste a conexão e crie o novo serviço vinculado.

Detalhes da configuração do conector

As seções que se seguem fornecem detalhes sobre as propriedades que são usadas para definir entidades específicas dos Arquivos do Azure.

Propriedades do serviço vinculado

O conector dos Arquivos do Azure dá suporte aos seguintes tipos de autenticação. Consulte as seções correspondentes para obter detalhes.

Autenticação de chave de conta
Autenticação de assinatura de acesso compartilhado
Autenticação de identidade gerenciada atribuída pelo sistema
Autenticação de identidade gerenciada atribuída pelo usuário

Observação

Se você estiver usando o serviço vinculado dos Arquivos do Azure com o modelo herdado, onde, na criação do ADF, a interface do usuário é mostrada como "Autenticação básica", ele ainda terá suporte no estado em que se encontra, enquanto será sugerido que você use o novo modelo no futuro. O modelo herdado transfere dados de/para o armazenamento por SMB (Bloco de Mensagens do Servidor), enquanto o novo modelo utiliza o SDK de armazenamento que tem uma taxa de transferência melhor. Para atualizar, você pode editar seu serviço vinculado para alternar o método de autenticação para "Chave de conta" ou "URI de SAS"; não é necessário fazer alteração no conjunto de dados ou na atividade de cópia.

Autenticação de chave de conta

O Data Factory dá suporte às seguintes propriedades para autenticação de chave de conta dos Arquivos do Azure:

Propriedade	Descrição	Obrigatório
type	A propriedade type deve ser definida como: AzureFileStorage.	Sim
connectionString	Especifique as informações necessárias para se conectar aos Arquivos do Azure. Você também pode colocar a chave de conta no Azure Key Vault e efetuar pull da configuração `accountKey` da cadeia de conexão. Para obter mais informações, consulte os exemplos a seguir e o artigo Credenciais do Armazenamento no Azure Key Vault.	Sim
fileShare	Especifique o compartilhamento de arquivo.	Sim
instantâneo	Especifique a data do instantâneo de compartilhamento de arquivo se você quiser copiar de um instantâneo.	Não
connectVia	O Integration Runtime a ser usado para se conectar ao armazenamento de dados. Você pode usar o Integration Runtime do Azure ou o Integration Runtime auto-hospedado (se o armazenamento de dados estiver localizado em uma rede privada). Se não for especificado, ele usa o Integration Runtime padrão do Azure.	Não

Exemplo:

{
    "name": "AzureFileStorageLinkedService",
    "properties": {
        "type": "AzureFileStorage",
        "typeProperties": {
            "connectionString": "DefaultEndpointsProtocol=https;AccountName=<accountName>;AccountKey=<accountKey>;EndpointSuffix=core.windows.net;",
            "fileShare": "<file share name>"
        },
        "connectVia": {
          "referenceName": "<name of Integration Runtime>",
          "type": "IntegrationRuntimeReference"
        }
    }
}

Exemplo: armazenar a chave de conta no Azure Key Vault

{
    "name": "AzureFileStorageLinkedService",
    "properties": {
        "type": "AzureFileStorage",
        "typeProperties": {
            "connectionString": "DefaultEndpointsProtocol=https;AccountName=<accountname>;",
            "fileShare": "<file share name>",
            "accountKey": { 
                "type": "AzureKeyVaultSecret", 
                "store": { 
                    "referenceName": "<Azure Key Vault linked service name>", 
                    "type": "LinkedServiceReference" 
                }, 
                "secretName": "<secretName>" 
            }
        },
        "connectVia": {
            "referenceName": "<name of Integration Runtime>",
            "type": "IntegrationRuntimeReference"
        }            
    }
}

Autenticação de assinatura de acesso compartilhado

Uma assinatura de acesso compartilhado fornece acesso delegado aos recursos da sua conta de armazenamento. Você pode usar uma assinatura de acesso compartilhado para conceder a um cliente permissões limitadas para objetos em sua conta de armazenamento por determinado tempo. Para obter mais informações sobre assinaturas de acesso compartilhado, consulte Assinaturas de acesso compartilhado: Entender o modelo de assinatura de acesso compartilhado.

O serviço dá suporte às seguintes propriedades para usar a autenticação de assinatura de acesso compartilhado:

Propriedade	Descrição	Obrigatório
type	A propriedade type deve ser definida como: AzureFileStorage.	Sim
sasUri	Especifique o URI da assinatura de acesso compartilhado para os recursos. Marque esse campo como SecureString para armazená-lo com segurança. Você também pode colocar o token SAS no Azure Key Vault para aproveitar a rotação automática e remover a parte do token. Para obter mais informações, consulte os exemplos a seguir e Credenciais do Armazenamento no Azure Key Vault.	Sim
fileShare	Especifique o compartilhamento de arquivo.	Sim
instantâneo	Especifique a data do instantâneo de compartilhamento de arquivo se você quiser copiar de um instantâneo.	Não
connectVia	O Integration Runtime a ser usado para se conectar ao armazenamento de dados. Você pode usar o Integration Runtime do Azure ou o Integration Runtime auto-hospedado (se o armazenamento de dados estiver localizado em uma rede privada). Se não for especificado, ele usa o Integration Runtime padrão do Azure.	Não

Exemplo:

{
    "name": "AzureFileStorageLinkedService",
    "properties": {
        "type": "AzureFileStorage",
        "typeProperties": {
            "sasUri": {
                "type": "SecureString",
                "value": "<SAS URI of the resource e.g. https://<accountname>.file.core.windows.net/?sv=<storage version>&st=<start time>&se=<expire time>&sr=<resource>&sp=<permissions>&sip=<ip range>&spr=<protocol>&sig=<signature>>"
            },
            "fileShare": "<file share name>",
            "snapshot": "<snapshot version>"
        },
        "connectVia": {
            "referenceName": "<name of Integration Runtime>",
            "type": "IntegrationRuntimeReference"
        }
    }
}

Exemplo: armazenar o token SAS em Azure Key Vault

{
    "name": "AzureFileStorageLinkedService",
    "properties": {
        "type": "AzureFileStorage",
        "typeProperties": {
            "sasUri": {
                "type": "SecureString",
                "value": "<SAS URI of the Azure Storage resource without token e.g. https://<accountname>.file.core.windows.net/>"
            },
            "sasToken": { 
                "type": "AzureKeyVaultSecret", 
                "store": { 
                    "referenceName": "<Azure Key Vault linked service name>", 
                    "type": "LinkedServiceReference" 
                }, 
                "secretName": "<secretName with value of SAS token e.g. ?sv=<storage version>&st=<start time>&se=<expire time>&sr=<resource>&sp=<permissions>&sip=<ip range>&spr=<protocol>&sig=<signature>>" 
            },
            "fileShare": "<file share name>"
        },
        "connectVia": {
            "referenceName": "<name of Integration Runtime>",
            "type": "IntegrationRuntimeReference"
        }
    }
}

Autenticação de identidade gerenciada atribuída pelo sistema

Um pipeline do data factory ou do Synapse pode ser associado a uma identidade gerenciada atribuída pelo sistema para recursos do Azure, que representa esse recurso para autenticação em outros serviços do Azure. Você pode usar essa identidade gerenciada atribuída pelo sistema para autenticação de Arquivos do Azure. Para saber mais sobre as identidades gerenciadas para recursos do Azure, confira Identidades gerenciadas para recursos do Azure.

Para usar a autenticação de identidade gerenciada atribuída pelo sistema, siga estas etapas:

Recuperar identidade gerenciada atribuída pelo sistema copiando o valor da ID de objeto de identidade gerenciada atribuída pelo sistema gerado com o workspace do Factory ou do Synapse.
Conceda a permissão de identidade gerenciada nos Arquivos do Azure. Para mais informações sobre as funções, confira este artigo.
- Como origem, em Controle de acesso (IAM), conceda pelo menos a função Leitor privilegiado de dados de arquivo de armazenamento.
- Como coletor, em Controle de acesso (IAM), conceda pelo menos a função Colaborador privilegiado de dados de arquivo de armazenamento.

Essas propriedades têm suporte para um serviço vinculado de Arquivos do Azure:

Propriedade	Descrição	Obrigatório
tipo	A propriedade Digitar deve ser definida como AzureFileStorage.	Sim
serviceEndpoint	Especifique o ponto final do serviço Arquivos do Azure com o padrão de `https://<accountName>.file.core.windows.net/`.	Sim
fileShare	Especifique o compartilhamento de arquivo.	Sim
instantâneo	Especifique a data do instantâneo de compartilhamento de arquivo se você quiser copiar de um instantâneo.	Não
connectVia	O Integration Runtime a ser usado para se conectar ao armazenamento de dados. Você pode usar o Azure Integration Runtime. Se não for especificado, ele usa o Integration Runtime padrão do Azure.	Não

Observação

A autenticação com identidade gerenciada atribuída pelo sistema só tem suporte no Azure Integration Runtime.

Exemplo:

{
    "name": "AzureFileStorageLinkedService",
    "properties": {
        "type": "AzureFileStorage",
        "typeProperties": {            
            "serviceEndpoint": "https://<accountName>.file.core.windows.net/",
            "fileShare": "<file share name>",
            "snapshot": "<snapshot version>"
        },
        "connectVia": {
            "referenceName": "<name of Integration Runtime>",
            "type": "IntegrationRuntimeReference"
        }
    }
}

Autenticação de identidade gerenciada atribuída pelo usuário

Um data factory pode ser atribuído com uma ou várias identidades gerenciadas atribuídas pelo usuário. Você pode usar essa identidade gerenciada atribuída pelo usuário para autenticação de Arquivos do Azure, que permite acessar e copiar dados de ou para Arquivos do Azure. Para saber mais sobre as identidades gerenciadas para recursos do Azure, confira Identidades gerenciadas para recursos do Azure.

Para usar a autenticação de identidade gerenciada atribuída pelo usuário, siga estas etapas:

Crie uma ou várias identidades gerenciadas atribuídas ao usuário e conceda permissão nos Arquivos do Azure. Para mais informações sobre as funções, confira este artigo.
- Como origem, em Controle de acesso (IAM), conceda pelo menos a função Leitor privilegiado de dados de arquivo de armazenamento.
- Como coletor, em Controle de acesso (IAM), conceda pelo menos a função Colaborador privilegiado de dados de arquivo de armazenamento.
Atribua uma ou várias identidades gerenciadas atribuídas pelo usuário a seu data factory e crie credenciais para cada identidade gerenciada atribuída pelo usuário.

Essas propriedades têm suporte para um serviço vinculado de Arquivos do Azure:

Propriedade	Descrição	Obrigatório
tipo	A propriedade Digitar deve ser definida como AzureFileStorage.	Sim
serviceEndpoint	Especifique o ponto final do serviço Arquivos do Azure com o padrão de `https://<accountName>.file.core.windows.net/`.	Sim
credenciais	Especifique a identidade gerenciada atribuída pelo usuário como o objeto da credencial.	Sim
fileShare	Especifique o compartilhamento de arquivo.	Sim
instantâneo	Especifique a data do instantâneo de compartilhamento de arquivo se você quiser copiar de um instantâneo.	Não
connectVia	O Integration Runtime a ser usado para se conectar ao armazenamento de dados. Você pode usar o Integration Runtime do Azure ou o Integration Runtime auto-hospedado (se o armazenamento de dados estiver localizado em uma rede privada). Se não for especificado, ele usa o Integration Runtime padrão do Azure.	Não

Exemplo:

{
    "name": "AzureFileStorageLinkedService",
    "properties": {
        "type": "AzureFileStorage",
        "typeProperties": {            
            "serviceEndpoint": "https://<accountName>.file.core.windows.net/",
            "credential": {
                "referenceName": "credential1",
                "type": "CredentialReference"
            },
            "fileShare": "<file share name>",
            "snapshot": "<snapshot version>"
        },
        "connectVia": {
            "referenceName": "<name of Integration Runtime>",
            "type": "IntegrationRuntimeReference"
        }
    }
}

Modelo herdado

Propriedade	Descrição	Obrigatório
type	A propriedade type deve ser definida como: AzureFileStorage.	Sim
host	Especifica o ponto de extremidade dos Arquivos do Azure como: \- Usando a interface do usuário: especifique `\\<storage name>.file.core.windows.net\<file service name>` - Usando o JSON: `"host": "\\\\<storage name>.file.core.windows.net\\<file service name>"`.	Sim
userid	Especifica o usuário para acessar os Arquivos do Azure como: \- Usando a interface do usuário: especifique `AZURE\<storage name>` \- Usando o JSON: `"userid": "AZURE\\<storage name>"`.	Sim
password	Especifique a chave de acesso de armazenamento. Marque este campo como uma SecureString para armazená-la com segurança no Data Factory ou faça referência a um segredo armazenado no Azure Key Vault.	Sim
connectVia	O Integration Runtime a ser usado para se conectar ao armazenamento de dados. Você pode usar o Integration Runtime do Azure ou o Integration Runtime auto-hospedado (se o armazenamento de dados estiver localizado em uma rede privada). Se não for especificado, ele usa o Integration Runtime padrão do Azure.	Não para fonte, Sim para o coletor

Exemplo:

{
    "name": "AzureFileStorageLinkedService",
    "properties": {
        "type": "AzureFileStorage",
        "typeProperties": {
            "host": "\\\\<storage name>.file.core.windows.net\\<file service name>",
            "userid": "AZURE\\<storage name>",
            "password": {
                "type": "SecureString",
                "value": "<storage access key>"
            }
        },
        "connectVia": {
            "referenceName": "<name of Integration Runtime>",
            "type": "IntegrationRuntimeReference"
        }
    }
}

Propriedades do conjunto de dados

Para obter uma lista completa das seções e propriedades disponíveis para definir os conjuntos de dados, confira o artigo sobre Conjuntos de Dados.

O Azure Data Factory é compatível com os formatos de arquivo a seguir. Confira cada artigo para obter configurações baseadas em formato.

As propriedades a seguir são suportadas para os Arquivos do Azure em location configurações de conjunto de dados baseado em formato:

Propriedade	Descrição	Obrigatório
type	A propriedade de tipo em `location` no conjunto de dados deve ser definida como AzureFileStorageLocation.	Sim
folderPath	O caminho para a pasta. Se quiser usar um caractere curinga para filtrar a pasta, ignore essa configuração e especifique nas configurações de origem da atividade.	Não
fileName	O nome do arquivo sob o folderPath fornecido. Se quiser usar um caractere curinga para filtrar os arquivos, ignore essa configuração e especifique nas configurações de origem da atividade.	Não

Exemplo:

{
    "name": "DelimitedTextDataset",
    "properties": {
        "type": "DelimitedText",
        "linkedServiceName": {
            "referenceName": "<Azure File Storage linked service name>",
            "type": "LinkedServiceReference"
        },
        "schema": [ < physical schema, optional, auto retrieved during authoring > ],
        "typeProperties": {
            "location": {
                "type": "AzureFileStorageLocation",
                "folderPath": "root/folder/subfolder"
            },
            "columnDelimiter": ",",
            "quoteChar": "\"",
            "firstRowAsHeader": true,
            "compressionCodec": "gzip"
        }
    }
}

Propriedades da atividade de cópia

Para obter uma lista completa das seções e propriedades disponíveis para definir atividades, confia o artigo Pipelines. Esta seção fornece uma lista das propriedades com suporte pela fonte e pelo coletor dos Arquivos do Azure.

Arquivos do Azure como origem

O Azure Data Factory é compatível com os formatos de arquivo a seguir. Confira cada artigo para obter configurações baseadas em formato.

Os Arquivos do Azure dão suporte às seguintes propriedades nas configurações storeSettings na origem da cópia baseada no formato:

Propriedade	Descrição	Obrigatório
type	A propriedade type em `storeSettings` deve ser configurada como AzureFileStorageReadSettings.	Sim
Localize os arquivos a serem copiados:
OPÇÃO 1: caminho estático	Copiar do caminho de pasta/arquivo especificado no conjunto de dados. Se quiser copiar todos os arquivos de uma pasta, especifique também `wildcardFileName` como `*`.
OPÇÃO 2: prefixo do arquivo - prefix	Prefixo para o nome do arquivo sob o compartilhamento de arquivo especificado configurado no conjunto de dados para filtrar os arquivos de origem. Arquivos com nome começando com o `fileshare_in_linked_service/this_prefix` são selecionados. Ele utiliza o filtro do lado do serviço para os Arquivos do Azure, que fornece melhor desempenho do que um filtro curinga. Não há suporte para esse recurso ao usar um modelo de serviço vinculado herdado.	Não
OPÇÃO 3: curinga - wildcardFolderPath	O caminho da pasta com caracteres curinga para filtrar as pastas de origem. Os curingas permitidos são: `*` (corresponde a zero ou mais caracteres) e `?` (corresponde a zero ou caractere único); use `^` para escape se o nome de pasta atual tiver curinga ou esse caractere interno de escape. Veja mais exemplos em Exemplos de filtro de pastas e arquivos.	Não
OPÇÃO 3: curinga - wildcardFileName	O nome do arquivo com caracteres curinga sob o folderPath/wildcardFolderPath fornecido para filtrar os arquivos de origem. Os curingas permitidos são: `*` (corresponde a zero ou mais caracteres) e `?` (corresponde a zero ou caractere único); use `^` para escape se o nome de arquivo real tiver curinga ou esse caractere interno de escape. Veja mais exemplos em Exemplos de filtro de pastas e arquivos.	Sim
OPÇÃO 4: uma lista de arquivos - fileListPath	Indica a cópia de um determinado conjunto de arquivos. Aponte para um arquivo de texto que inclui a lista de arquivos que você deseja copiar com um arquivo por linha, que é o caminho relativo para o caminho configurado no conjunto de dados. Ao usar essa opção, não especifique o nome do arquivo no conjunto de dados. Veja mais exemplos em Exemplos de lista de arquivos.	Não
Configurações adicionais:
recursiva	Indica se os dados são lidos recursivamente das subpastas ou somente da pasta especificada. Quando recursiva é definida como true e o coletor é um armazenamento baseado em arquivo, uma pasta vazia ou subpasta não é copiada ou criada no coletor. Os valores permitidos são true (padrão) e false. Essa propriedade não se aplica quando você configura `fileListPath`.	Não
deleteFilesAfterCompletion	Indica se os arquivos binários serão excluídos do repositório de origem após a movimentação com êxito para o repositório de destino. A exclusão do arquivo é feita por arquivo, portanto, quando a atividade de cópia falhar, você verá que alguns arquivos já foram copiados para o destino e excluídos da origem, enquanto outros ainda permanecem no repositório de origem. Essa propriedade só é válida no cenário de cópia de arquivos binários. O valor padrão é false.	Não
modifiedDatetimeStart	Filtro de arquivos com base no atributo: Última Modificação. Os arquivos serão selecionados se a hora da última modificação for maior ou igual a `modifiedDatetimeStart` e menor que `modifiedDatetimeEnd`. A hora é aplicada ao fuso horário de UTC no formato "2018-12-01T05:00:00Z". As propriedades podem ser NULL, o que significa que nenhum filtro de atributo de arquivo será aplicado ao conjunto de dados. Quando `modifiedDatetimeStart` tem o valor de data e hora, mas `modifiedDatetimeEnd` for NULL, isso significa que serão selecionados os arquivos cujo último atributo modificado é maior ou igual ao valor de data e hora. Quando `modifiedDatetimeEnd` tem o valor de data e hora, mas `modifiedDatetimeStart` for NULL, isso significa que serão selecionados os arquivos cujo último atributo modificado é menor que o valor de data e hora. Essa propriedade não se aplica quando você configura `fileListPath`.	Não
modifiedDatetimeEnd	Mesmo que acima.	Não
enablePartitionDiscovery	Para arquivos que são particionados, especifique se deseja analisar as partições do caminho do arquivo e adicioná-las como colunas de origem adicionais. Os valores permitidos são false (padrão) e true.	No
partitionRootPath	Quando a descoberta de partição estiver habilitada, especifique o caminho raiz absoluto para ler as pastas particionadas como colunas de dados. Se ele não for especificado, por padrão ocorrerá o seguinte: – Quando você usa o caminho do arquivo no conjunto de dados ou na lista de arquivos na origem, o caminho raiz da partição é o caminho configurado no conjunto de dados. – Quando você usa o filtro de pasta curinga, o caminho raiz da partição é o subcaminho antes do primeiro curinga. Por exemplo, supondo que você configure o caminho no conjunto de dados como "root/folder/year=2020/month=08/day=27": – Se você especifica o caminho raiz da partição como "root/folder/year=2020", a atividade de cópia gera mais duas colunas `month` e `day` com o valor "08" e "27", respectivamente, além das colunas dentro dos arquivos. – Se o caminho raiz da partição não for especificado, nenhuma coluna extra será gerada.	Não
maxConcurrentConnections	O limite superior de conexões simultâneas estabelecidas com o armazenamento de dados durante a execução da atividade. Especifique um valor somente quando desejar limitar as conexões simultâneas.	Não

Exemplo:

"activities":[
    {
        "name": "CopyFromAzureFileStorage",
        "type": "Copy",
        "inputs": [
            {
                "referenceName": "<Delimited text input dataset name>",
                "type": "DatasetReference"
            }
        ],
        "outputs": [
            {
                "referenceName": "<output dataset name>",
                "type": "DatasetReference"
            }
        ],
        "typeProperties": {
            "source": {
                "type": "DelimitedTextSource",
                "formatSettings":{
                    "type": "DelimitedTextReadSettings",
                    "skipLineCount": 10
                },
                "storeSettings":{
                    "type": "AzureFileStorageReadSettings",
                    "recursive": true,
                    "wildcardFolderPath": "myfolder*A",
                    "wildcardFileName": "*.csv"
                }
            },
            "sink": {
                "type": "<sink type>"
            }
        }
    }
]

Arquivos do Azure como coletor

O Azure Data Factory é compatível com os formatos de arquivo a seguir. Confira cada artigo para obter configurações baseadas em formato.

Os Arquivos do Azure dão suporte às seguintes propriedades nas configurações storeSettings no coletor da cópia baseada no formato:

Propriedade	Descrição	Obrigatório
type	A propriedade type em `storeSettings` deve ser configurada com AzureFileStorageWriteSettings.	Sim
copyBehavior	Define o comportamento de cópia quando a fonte for de arquivos de um armazenamento de dados baseado em arquivo. Valores permitidos são: – PreserveHierarchy (padrão): Preserva a hierarquia de arquivos na pasta de destino. O caminho relativo do arquivo de origem para a pasta de origem é idêntico ao caminho relativo do arquivo de destino para a pasta de destino. – FlattenHierarchy: Todos os arquivos da pasta de origem estão no primeiro nível da pasta de destino. Os arquivos de destino têm os nomes gerados automaticamente. – MergeFiles: Mescla todos os arquivos da pasta de origem em um arquivo. Se o nome do arquivo for especificado, o nome do arquivo mesclado será o nome especificado. Caso contrário, ele será um nome de arquivo gerado automaticamente.	Não
maxConcurrentConnections	O limite superior de conexões simultâneas estabelecidas com o armazenamento de dados durante a execução da atividade. Especifique um valor somente quando desejar limitar as conexões simultâneas.	Não

Exemplo:

"activities":[
    {
        "name": "CopyToAzureFileStorage",
        "type": "Copy",
        "inputs": [
            {
                "referenceName": "<input dataset name>",
                "type": "DatasetReference"
            }
        ],
        "outputs": [
            {
                "referenceName": "<Parquet output dataset name>",
                "type": "DatasetReference"
            }
        ],
        "typeProperties": {
            "source": {
                "type": "<source type>"
            },
            "sink": {
                "type": "ParquetSink",
                "storeSettings":{
                    "type": "AzureFileStorageWriteSettings",
                    "copyBehavior": "PreserveHierarchy"
                }
            }
        }
    }
]

Exemplos de filtro de pasta e arquivo

Esta seção descreve o comportamento resultante do caminho da pasta e do nome de arquivo com filtros curinga.

folderPath	fileName	recursiva	Estrutura da pasta de origem e resultado do filtro (os arquivos em negrito são recuperados)
`Folder*`	(vazio, usar padrão)	false	FolderA Arquivo1.csv File2.json Subpasta1 File3.csv File4.json File5.csv OutraPastaB Arquivo6.csv
`Folder*`	(vazio, usar padrão)	true	FolderA Arquivo1.csv File2.json Subpasta1 File3.csv File4.json File5.csv OutraPastaB Arquivo6.csv
`Folder*`	`*.csv`	false	FolderA Arquivo1.csv Arquivo2.json Subpasta1 File3.csv File4.json File5.csv OutraPastaB Arquivo6.csv
`Folder*`	`*.csv`	true	FolderA Arquivo1.csv Arquivo2.json Subpasta1 File3.csv File4.json File5.csv OutraPastaB Arquivo6.csv

Exemplos de lista de arquivos

Esta seção descreve o comportamento resultante do uso do caminho da lista de arquivos na origem da atividade de cópia.

Supondo que você tenha a seguinte estrutura de pasta de origem e queira copiar os arquivos em negrito:

Exemplo de estrutura de origem	Conteúdo em FileListToCopy.txt	Configuração
root FolderA Arquivo1.csv Arquivo2.json Subpasta1 File3.csv File4.json File5.csv Metadados FileListToCopy.txt	File1.csv Subfolder1/File3.csv Subfolder1/File5.csv	No conjunto de dados: - Caminho da pasta: `root/FolderA` Na origem da atividade de cópia: - Caminho da lista de arquivos: `root/Metadata/FileListToCopy.txt` O caminho da lista de arquivos aponta para um arquivo de texto no mesmo armazenamento de dados que inclui a lista de arquivos que você deseja copiar, um arquivo por linha, com o caminho relativo do caminho configurado no conjunto de dados.

exemplos de recursive e copyBehavior

Esta seção descreve o comportamento resultante da operação de cópia para diferentes combinações de valores recursive e copyBehavior.

recursiva	copyBehavior	Estrutura de pasta de origem	Destino resultante
true	preserveHierarchy	Pasta1 Arquivo1 Arquivo2 Subpasta1 Arquivo3 Arquivo4 Arquivo5	A pasta de destino Pasta1 é criada com a mesma estrutura da origem: Pasta1 Arquivo1 Arquivo2 Subpasta1 Arquivo3 Arquivo4 Arquivo5.
true	flattenHierarchy	Pasta1 Arquivo1 Arquivo2 Subpasta1 Arquivo3 Arquivo4 Arquivo5	A Pasta1 de destino é criada com a seguinte estrutura: Pasta1 nome gerado automaticamente para o Arquivo1 nome gerado automaticamente para o Arquivo2 nome gerado automaticamente para o Arquivo3 nome gerado automaticamente para o Arquivo4 nome gerado automaticamente para o Arquivo5
true	mergeFiles	Pasta1 Arquivo1 Arquivo2 Subpasta1 Arquivo3 Arquivo4 Arquivo5	A Pasta1 de destino é criada com a seguinte estrutura: Pasta1 Os conteúdos de Arquivo1 + Arquivo2 + Arquivo3 + Arquivo4 + Arquivo5 são mesclados em um único arquivo com um nome de arquivo gerado automaticamente
false	preserveHierarchy	Pasta1 Arquivo1 Arquivo2 Subpasta1 Arquivo3 Arquivo4 Arquivo5	A pasta de destino Pasta1 é criada com a seguinte estrutura Pasta1 Arquivo1 Arquivo2 Subpasta1 com Arquivo3, Arquivo4 e Arquivo5 não são selecionados.
false	flattenHierarchy	Pasta1 Arquivo1 Arquivo2 Subpasta1 Arquivo3 Arquivo4 Arquivo5	A pasta de destino Pasta1 é criada com a seguinte estrutura Pasta1 nome gerado automaticamente para o Arquivo1 nome gerado automaticamente para o Arquivo2 Subpasta1 com Arquivo3, Arquivo4 e Arquivo5 não são selecionados.
false	mergeFiles	Pasta1 Arquivo1 Arquivo2 Subpasta1 Arquivo3 Arquivo4 Arquivo5	A pasta de destino Pasta1 é criada com a seguinte estrutura Pasta1 Os conteúdos de Arquivo1 + Arquivo2 são mesclados em um arquivo com um nome de arquivo gerado automaticamente. nome gerado automaticamente para o Arquivo1 Subpasta1 com Arquivo3, Arquivo4 e Arquivo5 não são selecionados.

Pesquisar propriedades de atividades

Para saber detalhes sobre as propriedades, verifique Atividade de pesquisa.

Propriedades de atividade GetMetadata

Para saber detalhes sobre as propriedades, verifique Atividade GetMetadata

Excluir propriedades da atividade

Para saber mais detalhes sobre as propriedades, marque Excluir atividade

Modelos herdados

Observação

Os modelos a seguir ainda têm suporte no estado em que se encontram, para compatibilidade com versões anteriores. É recomendável usar o novo modelo mencionado nas seções acima no futuro, e a interface do usuário de criação mudou para gerar o novo modelo.

Modelo de conjunto de dados herdado

Propriedade	Descrição	Obrigatório
type	A propriedade type do conjunto de dados deve ser definida como: FileShare	Sim
folderPath	Caminho para a pasta. O filtro curinga é permitido; os curingas permitidos são: `*` (corresponde a zero ou mais caracteres) e `?` (corresponde a zero ou caractere único); use `^` para escape se o nome real da pasta tiver um curinga ou esse caractere interno de escape. Exemplos: rootfolder/subfolder/; veja mais exemplos em Exemplos de filtro de pasta e arquivo.	Sim
fileName	Filtro de nome ou curinga para os arquivos em "folderPath" especificado. Se você não especificar um valor para essa propriedade, o conjunto de dados apontará para todos os arquivos na pasta. Para filtro, os curingas permitidos são: `` (corresponde a zero ou mais caracteres) e `?` (corresponde a zero ou caractere único). – Exemplo 1: `"fileName": ".csv"` – Exemplo 2: `"fileName": "???20180427.txt"` Use `^` para se seu nome de arquivo real curinga ou esse caractere de escape dentro de escape. Quando fileName não é especificado para um conjunto de dados de saída e preserveHierarchy não é especificado no coletor de atividade, a atividade de cópia gera automaticamente o nome do arquivo com o seguinte padrão: "Data.[GUID da ID da execução de atividade].[GUID se FlattenHierarchy].[formato se configurado].[compactação se configurada] ", por exemplo: "Data.0a405f8a-93ff-4c6f-b3be-f69616f1df7a.txt.gz". Se você copiar da origem da tabela usando o nome da tabela em vez da consulta, o nome padrão será " [nome da tabela].[formato].[compactação se configurada] ", por exemplo: "MyTable.csv".	Não
modifiedDatetimeStart	Filtro de arquivos com base no atributo: Última Modificação. Os arquivos serão selecionados se a hora da última modificação for maior ou igual a `modifiedDatetimeStart` e menor que `modifiedDatetimeEnd`. A hora é aplicada ao fuso horário de UTC no formato "2018-12-01T05:00:00Z". Lembre-se de que o desempenho geral da movimentação de dados será afetado ao habilitar essa configuração, quando você desejar filtrar grandes quantidades de arquivos. As propriedades podem ser NULL, o que significa que nenhum filtro de atributo de arquivo será aplicado ao conjunto de dados. Quando `modifiedDatetimeStart` tem o valor de data e hora, mas `modifiedDatetimeEnd` for NULL, isso significa que serão selecionados os arquivos cujo último atributo modificado é maior ou igual ao valor de data e hora. Quando `modifiedDatetimeEnd` tem o valor de data e hora, mas `modifiedDatetimeStart` for NULL, isso significa que serão selecionados os arquivos cujo último atributo modificado é menor que o valor de data e hora.	Não
modifiedDatetimeEnd	Filtro de arquivos com base no atributo: Última Modificação. Os arquivos serão selecionados se a hora da última modificação for maior ou igual a `modifiedDatetimeStart` e menor que `modifiedDatetimeEnd`. A hora é aplicada ao fuso horário de UTC no formato "2018-12-01T05:00:00Z". Lembre-se de que o desempenho geral da movimentação de dados será afetado ao habilitar essa configuração, quando você desejar filtrar grandes quantidades de arquivos. As propriedades podem ser NULL, o que significa que nenhum filtro de atributo de arquivo será aplicado ao conjunto de dados. Quando `modifiedDatetimeStart` tem o valor de data e hora, mas `modifiedDatetimeEnd` for NULL, isso significa que serão selecionados os arquivos cujo último atributo modificado é maior ou igual ao valor de data e hora. Quando `modifiedDatetimeEnd` tem o valor de data e hora, mas `modifiedDatetimeStart` for NULL, isso significa que serão selecionados os arquivos cujo último atributo modificado é menor que o valor de data e hora.	Não
format	Se você quiser copiar arquivos no estado em que se encontram entre repositórios baseados em arquivo (cópia binária), ignore a seção de formato nas duas definições de conjunto de dados de entrada e de saída. Se você quer analisar ou gerar arquivos com um formato específico, os seguintes tipos de formato de arquivo são compatíveis: TextFormat, JsonFormat, AvroFormat, OrcFormat, ParquetFormat. Defina a propriedade type sob formato como um desses valores. Para saber mais, veja as seções Formato de texto, Formato Json, Formato Avro, Formato Orc, e Formato Parquet.	Não (somente para o cenário de cópia binária)
compactação	Especifique o tipo e o nível de compactação para os dados. Para obter mais informações, consulte Formatos de arquivo e codecs de compactação com suporte. Tipos compatíveis são: GZip, Deflate, BZip2 e ZipDeflate. Níveis compatíveis são: Ideal e Mais Rápido.	Não

Dica

Para copiar todos os arquivos em uma pasta, especifique folderPath somente.
Para copiar um único arquivo com um determinado nome, especifique folderPath com parte da pasta e fileName com nome de arquivo.
Para copiar um subconjunto de arquivos em uma pasta, especifique folderPath com parte da pasta e fileName com filtro curinga.

Observação

Se você estivesse usando a propriedade "fileFilter" para o filtro de arquivo, ele ainda tem suporte como-é, enquanto são sugeridos para usar o novo recurso de filtro adicionado ao "fileName" no futuro.

Exemplo:

{
    "name": "AzureFileStorageDataset",
    "properties": {
        "type": "FileShare",
        "linkedServiceName":{
            "referenceName": "<Azure File Storage linked service name>",
            "type": "LinkedServiceReference"
        },
        "typeProperties": {
            "folderPath": "folder/subfolder/",
            "fileName": "*",
            "modifiedDatetimeStart": "2018-12-01T05:00:00Z",
            "modifiedDatetimeEnd": "2018-12-01T06:00:00Z",
            "format": {
                "type": "TextFormat",
                "columnDelimiter": ",",
                "rowDelimiter": "\n"
            },
            "compression": {
                "type": "GZip",
                "level": "Optimal"
            }
        }
    }
}

Modelo de origem de atividade de cópia herdado

Propriedade	Descrição	Obrigatório
type	A propriedade type da fonte da atividade de cópia deve ser definida como: FileSystemSource	Sim
recursiva	Indica se os dados são lidos recursivamente a partir das subpastas ou somente da pasta especificada. Observe que quando o recursivo estiver definido como verdadeiro e o coletor for um armazenamento baseado em arquivo, subpasta/pasta vazia não será copiada/criada no coletor. Os valores permitidos são: true (padrão), false	Não
maxConcurrentConnections	O limite superior de conexões simultâneas estabelecidas com o armazenamento de dados durante a execução da atividade. Especifique um valor somente quando desejar limitar as conexões simultâneas.	Não

Exemplo:

"activities":[
    {
        "name": "CopyFromAzureFileStorage",
        "type": "Copy",
        "inputs": [
            {
                "referenceName": "<Azure File Storage input dataset name>",
                "type": "DatasetReference"
            }
        ],
        "outputs": [
            {
                "referenceName": "<output dataset name>",
                "type": "DatasetReference"
            }
        ],
        "typeProperties": {
            "source": {
                "type": "FileSystemSource",
                "recursive": true
            },
            "sink": {
                "type": "<sink type>"
            }
        }
    }
]

Modelo do coletor de atividade de cópia herdado

Propriedade	Descrição	Obrigatório
type	A propriedade type do coletor da atividade de cópia deve ser definida como: FileSystemSink	Sim
copyBehavior	Define o comportamento de cópia quando a fonte for de arquivos de armazenamento de dados baseado em arquivo. Valores permitidos são: - PreserveHierarchy (padrão): preserva a hierarquia de arquivos na pasta de destino. O caminho relativo do arquivo de origem para a pasta de origem é idêntico ao caminho relativo do arquivo de destino para a pasta de destino. - FlattenHierarchy: todos os arquivos da pasta de origem estão no primeiro nível da pasta de destino. Os arquivos de destino têm um nome gerado automaticamente. - MergeFiles: mescla todos os arquivos da pasta de origem em um arquivo. Se o nome do arquivo for especificado, o nome do arquivo mesclado será o nome especificado; caso contrário, será o nome de arquivo gerado automaticamente.	Não
maxConcurrentConnections	O limite superior de conexões simultâneas estabelecidas com o armazenamento de dados durante a execução da atividade. Especifique um valor somente quando desejar limitar as conexões simultâneas.	Não

Exemplo:

"activities":[
    {
        "name": "CopyToAzureFileStorage",
        "type": "Copy",
        "inputs": [
            {
                "referenceName": "<input dataset name>",
                "type": "DatasetReference"
            }
        ],
        "outputs": [
            {
                "referenceName": "<Azure File Storage output dataset name>",
                "type": "DatasetReference"
            }
        ],
        "typeProperties": {
            "source": {
                "type": "<source type>"
            },
            "sink": {
                "type": "FileSystemSink",
                "copyBehavior": "PreserveHierarchy"
            }
        }
    }
]

Para obter uma lista de armazenamentos de dados com suporte como coletores e fontes da atividade de cópia, confira os armazenamentos de dados com suporte.

Compartilhar via

Copiar dados de ou para os Arquivos do Azure usando o Azure Data Factory

Funcionalidades com suporte

Introdução

Criar um serviço vinculado para os Arquivos do Azure usando a interface do usuário

Detalhes da configuração do conector

Propriedades do serviço vinculado

Autenticação de chave de conta

Autenticação de assinatura de acesso compartilhado

Autenticação de identidade gerenciada atribuída pelo sistema

Autenticação de identidade gerenciada atribuída pelo usuário

Modelo herdado

Propriedades do conjunto de dados

Propriedades da atividade de cópia

Arquivos do Azure como origem

Arquivos do Azure como coletor

Exemplos de filtro de pasta e arquivo

Exemplos de lista de arquivos

exemplos de recursive e copyBehavior

Pesquisar propriedades de atividades

Propriedades de atividade GetMetadata

Excluir propriedades da atividade

Modelos herdados

Modelo de conjunto de dados herdado

Modelo de origem de atividade de cópia herdado

Modelo do coletor de atividade de cópia herdado

Comentários

Recursos adicionais

Compartilhar via

Copiar dados de ou para os Arquivos do Azure usando o Azure Data Factory

Funcionalidades com suporte

Introdução

Criar um serviço vinculado para os Arquivos do Azure usando a interface do usuário

Detalhes da configuração do conector

Propriedades do serviço vinculado

Autenticação de chave de conta

Autenticação de assinatura de acesso compartilhado

Autenticação de identidade gerenciada atribuída pelo sistema

Autenticação de identidade gerenciada atribuída pelo usuário

Modelo herdado

Propriedades do conjunto de dados

Propriedades da atividade de cópia

Arquivos do Azure como origem

Arquivos do Azure como coletor

Exemplos de filtro de pasta e arquivo

Exemplos de lista de arquivos

exemplos de recursive e copyBehavior

Pesquisar propriedades de atividades

Propriedades de atividade GetMetadata

Excluir propriedades da atividade

Modelos herdados

Modelo de conjunto de dados herdado

Modelo de origem de atividade de cópia herdado

Modelo do coletor de atividade de cópia herdado

Conteúdo relacionado

Comentários

Recursos adicionais