Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
I den här artikeln beskrivs metoder för att förbereda data för distribuerad träning.
För mycket stora datamängder som inte får plats i minnet använder du strömningsmetoder:
- PyTorch IterableDataset för anpassad strömningslogik .
- Hugging Face-datasets med strömning för dataset som finns på hubben eller i volymer.
- Ray Data för distribuerad batchdatabearbetning.
TFRecord
Du kan också använda TFRecord-format som datakälla för distribuerad djupinlärning. TFRecord-format är ett enkelt postorienterat binärt format som många TensorFlow-program använder för träningsdata.
tf.data.TFRecordDataset är TensorFlow-datauppsättningen, som består av poster från TFRecords-filer. Mer information om hur du använder TFRecord-data finns i TensorFlow-guiden Använda TFRecord-data.
Följande artiklar beskriver och illustrerar de rekommenderade sätten att spara dina data i TFRecord-filer och läsa in TFRecord-filer: