Выводы по модулю
Повторим главные тезисы третьего модуля:
Искусственный интеллект (artificial intelligence, AI) — это моделирование человеческого интеллекта в машинах, которые запрограммированы думать как люди и имитировать их действия.
01
Машинное обучение (machine learning, ML) — это использование математических моделей данных, которые помогают компьютеру обучаться без непосредственных инструкций.
02
Глубокое обучение (deep learning, DL) — это имитация работы человеческого мозга при обработке данных и создании шаблонов, которые можно использовать при принятии решений.
03
Наука о данных (data science, DS) — это междисциплинарная область, в которой используются научные методы, процессы, алгоритмы и системы для извлечения знаний и выводов из структурированных и неструктурированных данных, а также применения знаний и практических выводов из данных в широком спектре приложений.
04
Большие данные (big data, BD) — это большой объем структурированных и неструктурированных данных, которые ежедневно поступают в компании.
05
Cross Industry Standard Process for Data Mining (CRISP-DM) — стандарт, описывающий общие процессы аналитики данных и подходы к ней, используемые в проектах независимо от конкретной задачи и индустрии.
06
Согласно CRISP-DM, аналитический проект состоит из шести основных этапов, выполняемых последовательно:
07
Business Understanding / Бизнес-анализ
Data Understanding / Анализ данных
Data Preparation / Подготовка данных
Modeling / Моделирование
Evaluation / Оценка решения
Deployment / Внедрение
Различают три типа машинного обучения:
08
обучение с учителем, или контролируемое обучение (supervised learning)
обучение без учителя (unsupervised learning)
обучение с подкреплением (reinforced learning)
Есть 3 базовые выборки, на которые нужно делить процесс обучения модели:
09
тренировочная
валидационная
тестовая
Метрики делятся на офлайновые и онлайновые.
10
Матрица ошибок — это метрика производительности классифицирующей модели машинного обучения.
11
Компьютерное зрение (computer vision, CV) — это область искусственного интеллекта, связанная с анализом изображений и видео. Она включает в себя набор методов, которые наделяют компьютер способностью «видеть» и извлекать информацию из увиденного.
12
Графы — один из самых мощных и гибких способов представления данных. Они обладают большой выразительной силой и могут использоваться как обозначение большого числа систем в различных областях.
13
Большие языковые модели (LLM) — это часть natural language processing, передовые системы ИИ, предназначенные для обработки, понимания и создания текста, подобного человеческому.
14
ChatGPT — это языковая модель, разработанная компанией OpenAI, предназначенная для ответа на текстовые запросы и генерации ответов на естественном языке. Она известна как часть более широкой области ИИ — обработки естественного языка (НЛП), цель которой — обучение компьютеров пониманию и интерпретации человеческого языка.
15