Аннотация:
За последние десятилетия значительно выросло не только количество цифровых данных в мире, но и способов их использования. Пионером и долгое время синонимом платформы для хранения и обработки больших данных являлась экосистема Hadoop, которая и по сей день активно используется во множестве крупнейших компаний. Однако, за почти 20 лет, прошедших с первого релиза Hadoop, был выявлен ряд существенных недостатков, такие как «проблема маленьких файлов» и неравномерное использование ресурсов кластеров. Во многих коммерческий и исследовательских организациях встает вопрос о модернизации стека работы с данными для повышения утилизации ресурсов и расширения возможностей для эффективной работы с данными. Цель данной работы – продемонстрировать достоинства и недостатки хранилища данных нового поколения – Apache Ozone и сделать вывод о готовности технологии для полноценной замены распределенной файловой системы Hadoop (HDFS).
Ключевые слова:
хранение больших данных, распределенные файловые системы, объектное хранилище, S3, Apache Hadoop, Apache Ozone.