Урок курса

ndarray: создание из последовательностей и атрибуты структуры

NumPy и pandas: практический тренажёр

NumPy — это фундамент почти всего числового Python: pandas строит DataFrame поверх него, scikit-learn принимает массивы на вход, а большинство библиотек визуализации ожидают именно numpy-совместимые данные. Центральный объект здесь — ndarray, и с него и начнём.

ndarray как однородный многомерный контейнер

Python-список — гибкая штука: в него можно положить int, строку и ещё один список одновременно. Именно за счёт этой гибкости CPython хранит каждый элемент как отдельный Python-объект с собственным заголовком и счётчиком ссылок. Цена — дополнительная память и медленный доступ при числовых вычислениях.

ndarray устроен принципиально иначе. Его ключевое свойство — однородность: все элементы имеют одинаковый тип данных (dtype), единый для всего массива. Это позволяет NumPy хранить данные компактно и применять к ним векторизованные операции без перебора разнотипных Python-объектов. Физическое расположение данных в памяти — отдельная тема, которая выходит за рамки этого урока; для понимания ndarray достаточно знать, что однородный dtype — это фундаментальное свойство, а не деталь реализации.

Второе обязательное свойство — прямоугольность. Двумерный ndarray — это таблица, где все строки имеют одинаковое количество столбцов. «Рваных» строк разной длины в ndarray быть не может: если передать в np.array вложенные списки разной длины, NumPy поднимет ValueError и не создаст двумерный числовой массив. Это не ограничение, а гарантия: именно прямоугольная структура позволяет описывать форму массива одним кортежем чисел и применять операции ко всем элементам сразу.

Тип элементов — dtype — фиксируется в момент создания массива и единый для всего массива. Если передать список целых чисел, NumPy выберет целочисленный dtype. Если среди элементов окажется хотя бы одно число с плавающей точкой, весь массив станет вещественным — NumPy автоматически приведёт все значения к более широкому типу. Смешать int и строку в одном ndarray без потерь не получится: строки вытеснят числа в Unicode-тип, и арифметика станет недоступна.

Подытоживая модель: ndarray — это прямоугольный массив с элементами одного dtype, форма которого задаётся кортежем целых чисел. Всё остальное в NumPy — конструкторы, операции, индексирование — строится на этой модели.

Создание одномерного и двумерного ndarray через np.array

Единственная функция, которая нужна для старта — np.array(). Она принимает любую Python-последовательность и превращает её в ndarray.

Для одномерного массива передаём плоский список:

import numpy as np

a1 = np.array([10, 20, 30])
print(a1)
# [10 20 30]

Вывод уже отличается от Python-списка: нет запятых — это сигнал, что мы работаем с ndarray, а не с обычным list.

Для двумерного массива передаём вложенный список — список строк, где каждая строка сама является списком одинаковой длины:

a2 = np.array([[1, 2, 3],
               [4, 5, 6]])
print(a2)
# [[1 2 3]
#  [4 5 6]]

NumPy интерпретирует внешний список как набор строк, а каждый внутренний список — как строку таблицы. Длины внутренних списков обязаны совпадать — иначе прямоугольной формы не получится.

Автоматический вывод dtype. NumPy смотрит на переданные значения и выбирает тип самостоятельно. Если все элементы — целые числа Python, получится целочисленный dtype. Стоит добавить хотя бы одно число с точкой — и весь массив становится вещественным:

a_int   = np.array([1, 2, 3])
a_float = np.array([1, 2, 3.0])   # одна точка меняет тип всего массива

print(a_int.dtype)    # целочисленный dtype, например int32 или int64 — зависит от платформы
print(a_float.dtype)  # float64

Это прямое следствие однородности: NumPy обязан выбрать один тип для всего массива, поэтому берёт наиболее широкий из присутствующих. Конкретная ширина целочисленного dtype при автоматическом выводе зависит от платформы и сборки NumPy — если вам нужен гарантированный тип, задайте его явно.

Если нужен конкретный тип — передаём его явно через параметр dtype:

a_i64 = np.array([1, 2, 3], dtype=np.int64)
a_f32 = np.array([1, 2, 3], dtype=np.float32)

print(a_i64.dtype)  # int64
print(a_f32.dtype)  # float32

Явное указание dtype полезно, когда важна воспроизводимость поведения на разных платформах, когда нужна экономия памяти или когда последующий код ожидает строго определённый тип.

Посмотрим на оба массива вместе и убедимся, что NumPy создал именно то, что ожидалось:

print(a1)        # [10 20 30]
print(type(a1))  # <class 'numpy.ndarray'>

print(a2)
# [[1 2 3]
#  [4 5 6]]
print(type(a2))  # <class 'numpy.ndarray'>

Оба объекта — экземпляры numpy.ndarray. Отсюда следует следующий вопрос: как узнать форму, количество измерений и общее число элементов уже созданного массива? Для этого у ndarray есть набор атрибутов, которые мы разберём в следующей секции.

Атрибуты структуры массива: shape, ndim, size, dtype

Когда массив уже создан, нужно уметь быстро ответить на три вопроса: какова его форма, сколько у него измерений и сколько в нём элементов. Плюс — какой у него тип данных. Для этого у любого ndarray есть четыре атрибута: shape, ndim, size и dtype.

Возьмём массивы из предыдущего примера и считаем все четыре атрибута:

import numpy as np

a1 = np.array([10, 20, 30], dtype=np.int64)
a2 = np.array([[1, 2, 3],
               [4, 5, 6]], dtype=np.int64)

print(a1.shape, a1.ndim, a1.size, a1.dtype)
# (3,) 1 3 int64

print(a2.shape, a2.ndim, a2.size, a2.dtype)
# (2, 3) 2 6 int64

В этом примере dtype=np.int64 задан явно, поэтому последнее поле вывода одинаково на любой платформе. Всё остальное (shape, ndim, size) одинаково на любой платформе.

shape — кортеж целых чисел, по одному числу на каждое измерение. Для a1 это (3,): одно измерение, три элемента в нём. Запятая после 3 не опечатка — она нужна, чтобы Python понял, что это кортеж из одного элемента, а не просто число в скобках. Для a2 это (2, 3): две строки и три столбца.

ndim — количество измерений, то есть длина кортежа shape. У a11, у a22. Это число совпадает с глубиной вложенности списков, которые вы передавали в np.array: плоский список → ndim=1, список списков → ndim=2.

size — общее количество элементов в массиве. Для a1: 3. Для a2: 2 × 3 = 6. Ключевое соотношение: size всегда равен произведению всех чисел из shape. Это не совпадение, а определение: форма массива однозначно задаёт количество его элементов.

print(a2.shape[0] * a2.shape[1])  # 6
print(a2.size)                    # 6 — одно и то же

dtype — тип данных всех элементов. Если нужен гарантированный тип вне зависимости от платформы — задайте его явно:

a_i64 = np.array([[1, 2, 3],
                  [4, 5, 6]], dtype=np.int64)
print(a_i64.dtype)   # int64
print(a_i64.shape)   # (2, 3)

a_f32 = np.array([[1, 2, 3],
                  [4, 5, 6]], dtype=np.float32)
print(a_f32.dtype)   # float32
print(a_f32.shape)   # (2, 3)

Меняется только тип хранения, но не структура. shape, ndim и size остаются теми же при любом dtype.

Четыре атрибута вместе дают полное описание структуры массива: shape говорит, как именно он устроен по измерениям; ndim — сколько таких измерений; size — сколько клеток в этой «сетке» всего; dtype — что лежит в каждой клетке. Эта четвёрка понадобится постоянно: когда будете проверять результат операции, передавать массив в функцию или отлаживать несовпадение размерностей.

Попробуйте решить

Какой атрибут ndarray возвращает общее количество элементов в массиве?

Продолжить с проверкой и прогрессом

Откройте интерактивный раннер с заданиями урока.

Перейти к интерактивному уроку