С точки зрения анализа, статистических, визуализационных подходов и т. д. big data не отличается от небольших данных, которые можно обработать в Excel. Используя эту технологию, можно построить гистограмму, пироговую диаграмму или любую другую, которую вы привыкли делать в Excel. Сейчас цель развития технологии состоит в том, чтобы конечный пользователь не мог отличить работу Excel от big data. Так, чтобы все нюансы были скрыты под капотом и не пугали пользователя.
Представьте: любой крупный сервис генерирует огромное количество информации от клиентов: факты захода в приложение, использования услуг и т. д. Информация складывается на сервер, куда помещаются терабайты данных. При этом один компьютер позволяет в себя вместить десятки терабайт — за один день их возможно туда положить.
Допустим, речь идет о банке. Кто-то перевел 100 рублей, кто-то — 10 000, кто-то — 100 000. Мы хотим узнать среднюю величину транзакций за день. Это предполагает базовый уровень анализа данных, но считать придется очень долго. Компьютер будет перерабатывать 10 терабайт данных несколько дней — это неприемлемо. Так возникла идея использовать больше серверов.
Реализацию технологии назвали MapReduce. Это самый популярный, практически единственный подход к big data.