Калькулятор линейной регрессии

Линия наилучшего соответствия
Результаты

Линейная регрессия определяется уравнением y = mx + b, которое минимизирует сумму квадратов вертикальных отклонений данных. Это первый инструмент, который рекомендуется использовать при подозрении в связи между переменными, например, между расходами на рекламу и числом регистрации пользователей, температурой и объёмом продаж мороженого или ростом и размером обуви. Введите пары точек (x, y), и калькулятор вычислит наклон прямой, точку пересечения, коэффициент Р-квадрата и коэффициент корреляции Пирсона.

Как построить регрессионную линию

  1. 1

    Вставьте данные

    По одной паре значений на строку: переменные x и y разделены запятой, табуляцией или пробелом. Заголовки игнорируются.

  2. 2

    Читайте угол наклона и точку пересечения

    Наклон m, это изменение значения переменной y при изменении переменной x на единицу. Точка пересечения b, значение y при x = 0.

  3. 3

    Проверьте значение R².

    R² ∈ [0, 1], доля дисперсии переменной y, объясняемая переменной x. Значение выше 0,7 обычно указывает на высокую степень объяснения вариации в социальных данных.

  4. 4

    Прогнозируйте новые значения

    Подставьте любое значение x в уравнение y = m·x + b, чтобы получить прогноз модели.

Формулы, лежащие в основе аппроксимации

Для n точек данных (x_i, y_i) угловой коэффициент и постоянный член метода наименьших квадратов выражаются следующим образом:

m = Σ((x_i − x̄)(y_i − ȳ)) / Σ((x_i − x̄)²)
b = ȳ − m · x̄

R², коэффициент детерминации, представляет собой долю дисперсии переменной y, объясняемую переменной x.

R² = 1 − SS_res / SS_tot

где SS_res, сумма квадратов остатков, а SS_tot, сумма квадратов отклонений величины y от её среднего значения. Коэффициент корреляции Пирсона r равен ±√R² и имеет знак наклона линии регрессии.

Пример реализации

Пять точек данных:

x y
1 2
2 4
3 5
4 4
5 6

x = 3, y = 4,2. Числитель ковариации: (1 – 3)(2 – 4,2) + (2 – 3)(4 – 4,2) + (3 – 3)(5 – 4,2) + (4 – 3)(4 – 4,2) + (5 – 3)(6 – 4,2) = 4,4 + 0,2 + 0 – 0,2 + 3,6 = 8,0. Числитель дисперсии x: 4 + 1 + 0 + 1 + 4 = 10.

  • Наклон m = 8,0 / 10 = 0,8
  • Точка пересечения b = 4,2 − 0,8 × 3 = 1,8
  • Уравнение: y = 0,8x + 1,8
  • R² ≈ 0,727

Что показывают (и чего не показывают) цифры

  • Наклон m показывает, насколько изменяется значение y при увеличении x на единицу; его единица измерения, y/x.
  • Точка пересечения b отвечает на вопрос: «Каково значение y при x = 0?». Этот параметр имеет смысл только в том случае, если значение x = 0 соответствует вашим данным.
  • оценивает качество соответствия, а не причинно-следственную связь. Высокое значение R² на данных прокси без шума может быть бессмысленным.
  • Коэффициент корреляции Пирсона (r) характеризует линейную связь между переменными. Значение r близкое к нулю при выраженной криволинейной зависимости всё ещё означает «отсутствие линейной зависимости», а не «отсутствие связи» вообще.

Подводные камни

  • Аномальные значения сильно искажают результаты аппроксимации методом наименьших квадратов (МНК), поскольку функция потерь имеет квадратичную форму: одна аномальная точка может сдвинуть линию на 20 градусов.
  • Нелинейность не может быть выявлена только по значению R²; всегда необходимо построить график остатков в зависимости от переменной x.
  • Регрессия не симметрична: при аппроксимации переменной y по данным x получается другая линия, чем при аппроксимации переменной x по данным y.
  • Экстраполяция за пределы диапазона ваших данных является спекуляцией; модель учитывает только тот диапазон, который она получила.

Часто задаваемые вопросы

40 % вариации значения y объясняются линейной зависимостью от переменной x; оставшиеся 60 % обусловлены шумом, другими переменными или нелинейностью. В физике такой уровень объяснения считается низким; в социальных или экономических данных он зачастую приемлем.

Начните с линейной функции. Если график остатков демонстрирует чёткую кривую, попробуйте применить квадратичную или логарифмическую преобразование. Прямое переход к многочлену высокого порядка приводит к переобучению модели и плохой обобщаемости на новые данные.

С математической точки зрения требуется не менее двух значений; с практической точки зрения, как минимум двадцать. При меньшем числе данных один аномальный случай сильно влияет на результаты анализа. Для проверки опубликованных данных обратитесь к рекомендациям по размеру выборки, специфичным для вашей области.

Нет. Пары координат (x, y), которые вы вставляете, обрабатываются в вашем браузере и никогда не покидают страницу.

Сопутствующие инструменты

Калькулятор балясин

Введите свободный пролёт перил, ширину балясины и максимально допустимый зазор, чтобы получить точное количество необходимых балясин и равный промежуток между каждой стойкой, не превышающий нормативный предел.

Калькулятор длительности

Рассчитайте длительность между двумя часами в формате HH:MM, десятичных часах, минутах и секундах.

Калькулятор делительной окружности отверстий

Рассчитайте PCD, угловой шаг и точные координаты X/Y равномерных отверстий с поворотом, смещением центра и экспортом CSV.

Калькулятор длины ремня

Рассчитайте длину открытого ремня по делительной линии из диаметров двух шкивов и межосевого расстояния точным и приближённым методом.

Калькулятор гематрии

Рассчитайте значение гематрии для любого слова или фразы в шести английских шифрах: Simple/Ordinal, Full Reduction, Reverse, Sumerian и Jewish/Latin.

Калькулятор «сколько часов назад»

Узнайте точные дату и время, которые были заданное число часов назад от текущего момента.

Инструмент доступен на других языках