VAK Russia 2.8.4 UDC 004.622

EXPERIENCE IN BUILDING AN ML PROTOTYPE FOR PREDICTING COMPLICATIONS BASED ON FIELD DATA Experience in building an ML prototype for predicting complications based on field data

Published in Vestnik AGGE · Issue 3, 2026 · Pages 111–124 · Rubric: Conference proceedings
Received: 31.08.2026 Accepted: 21.09.2026 Published: 30.09.2026
Asphaltene, resin and paraffin deposits reduce the flow area of pipelines and cause unplanned workovers. Deposit thickness is not measured continuously on producing wells, so thermodynamic and hydraulic deposition models have to be tuned without any means of verification. This work tests an alternative: a well risk ranking trained on data the field collects continuously, namely monthly production reports, workover orders and the shutdown log. The target event is a workover or failure whose recorded cause points indirectly to deposits. The study covers a fund of 170 wells, the forecast horizon is 90 days, and quality is assessed on data separated in time from the training set. Nine ranking methods were compared, from a threshold rule based on field indicators to a random forest and a neural network.
asphalt-resin-paraffin deposits, AFS, predicting complications, machine learning, random forest, fund ranking, well repair, field data, weak marking
Text References
Text (PDF)
Read Download

Введение

Асфальтосмолопарафинистые отложения (АСПО) сопровождают добычу парафинистых нефтей на всем пути от призабойной зоны до пункта подготовки. Кристаллизация парафинов начинается при охлаждении потока ниже температуры насыщения, слой нарастает на стенке, проходное сечение уменьшается, гидравлические потери растут, гидравлическое сопротивление увеличивается параболически. Механизм описан в классических работах [1, 2] и в обзорах последних лет [4, 5]; лабораторные и трубные эксперименты дали количественные модели скорости осаждения [6–8], которые легли в основу инженерных расчетов для систем сбора [9].

Перенос этих моделей на действующий фонд упирается в одно обстоятельство. Толщина слоя на работающей скважине или в трубопроводе не измеряется напрямую, а лишь оценивается на качественном уровне. Косвенные способы оценки существуют [3], но применяются точечно и не дают численной зависимости, по которой можно настроить кинетические коэффициенты. Термодинамическое ядро требует состава флюида и температуры начала кристаллизации, которые определяются по единичным глубинным и поверхностным пробам [10–13], а результат распространяется на десятки скважин без валидации. Модель получается физически осмысленной и при этом непроверяемой.

Промысел между тем накапливает другие данные, и накапливает их сплошным потоком: месячные режимы, наряды на ремонт с указанием причины, журнал остановок, анализы попутной воды, перечень геолого‑технических мероприятий. Причина ремонта записывается оператором и относится к тому же явлению, что и толщина слоя, но с другой стороны: если отложения стали проблемой, скважину останавливают и промывают либо ремонтируют. Ремонтная запись работает как слабая метка события. Она не подтверждает первопричину и не измеряет толщину, зато существует по всему фонду и за все годы, когда велась отчетность.

Отсюда постановка задачи. Можно ли по ремонтной и режимной истории заранее оценить вероятность АСПО‑осложнения и упорядочить фонд по риску так, чтобы верхняя часть рейтинга содержала будущие ремонты заметно чаще средней по фонду? Вопрос сформулирован не как задача диагностики, а как задача приоритета выполнения мероприятий.

Работы, где машинное обучение применяется к отложению парафина, обычно опираются на лабораторные или трубные данные с известной скоростью осаждения [21]. Здесь исходные данные другие: разметка слабая, событий мало, признаки собраны из эксплуатационной отчетности. Такая постановка ближе к прогнозированию отказов оборудования, чем к моделированию выпадения и осаждения, и требует отдельной проверки применимости: заранее не очевидно, что связь между режимом работы и ремонтом сохраняется на фонде, где промывки проводятся регулярно.

Вклад работы состоит в следующем. Предложена и проверена на реальном фонде процедура построения рейтинга риска по данным эксплуатационной отчетности. Девять способов ранжирования сопоставлены на едином разбиении по времени, включая пороговое правило, которым такая задача решается сейчас. Измерено, насколько часто встречается событие в верхней части рейтинга по сравнению со средней частотой по фонду. Отдельно очерчены границы применимости метода, задаваемые слабой разметкой, редкостью событий и месячным осреднением данных.

Материалы

Объект исследования: фонд добывающих скважин одного цеха добычи нефти и газа, эксплуатирующего залежи с парафинистой нефтью. Из соображений конфиденциальности название цеха, номера скважин и координаты не приводятся, а показатели работы даны в обезличенном виде. Отобранный фонд насчитывает 170 скважин, период наблюдения с января 2020 г. по февраль 2026 г.

Использованные источники и извлеченные из них величины сведены в таблицу 1.

Таблица 1. Источники данных

Источник

Объем

Что извлечено

Месячные эксплуатационные режимы

170 скважин, 74 мес.

Дебиты нефти и жидкости, обводненность, пластовое и забойное давление, часы работы и простоя, способ эксплуатации

Наряды на подземный и капитальный ремонт

800 записей

Дата, вид работ, причина ремонта

Анализы попутной воды

по фонду

Плотность воды на последнюю дату отбора

Перечень мероприятий

по фонду

Факт гидроразрыва пласта за предшествующие 180 суток

Фактическую основу обучения составляют 2023–2025 гг. Масштаб ремонтной программы для механизированного фонда оптимальный. Восемьсот нарядов на 170 скважин за шесть лет отвечают примерно 0,8 ремонта на скважину в год, а размеченных АСПО‑событий приходится около 0,3 на скважину в год. Больше половины скважин, у которых событие было, имеют за весь период ровно одно, что говорит о хорошем состоянии фонда.

Лабораторный блок в расчет признаков не входит и привлекается только для истолкования результата. По трем пробам температура начала кристаллизации парафина составила от 15 до 20 °C при пластовой температуре 35 °C, давление насыщения от 4 до 9 МПа. Охлаждение потока до температур кристаллизации в стволе и выкидной линии физически достижимо, а доминирующим механизмом осложнения по лабораторным данным оказывается кристаллизация парафина, а не дестабилизация асфальтенов [11, 12].

Методы

Разметка целевого события

Прямого признака АСПО в отчетности нет, поэтому целевым событием принят ремонт или отказ, причина которого указывает на отложения косвенно. Формулировки причин разбирались по словарю. Строгий словарь включал только записи с явным упоминанием парафина или АСПО и дал 12 событий за шесть лет, чего для обучения недостаточно. Широкий словарь дополнительно включил запарафинивание, прочие отложения, заклинивание плунжера, засорение приема и клапанов. Он дал 325 событий, из них 12 с явным указанием. Записи с отложением солей и с обрывом штанг из разметки исключены как относящиеся к другим механизмам. Состав событий по причинам и распределение скважин по числу событий приведены на рисунке 1.

Рисунок 1. Целевые события: а) состав по записанной причине; б) распределение скважин по числу событий за период наблюдения

Две трети событий приходится на засорение насоса и заклинивание, то есть на формулировки, которые допускают и другие причины помимо отложений. Явное упоминание парафина встречается в 10 записях из 325. Больше половины скважин с событиями имеют одно событие за весь период, пять и более событий не имеет ни одна.

Отдельно размечены промывки: горячая промывка, обработка растворителем, депарафинизация скребком, заливка реагента. Таких работ зафиксировано 698, то есть вдвое больше, чем целевых событий: основная часть работы с отложениями выполняется в плановом порядке, до отказа. Промывка не считается целевым событием, поскольку она плановая, но служит признаком: время с последней промывки и их число за год характеризуют историю борьбы с отложениями на конкретной скважине. Медианный интервал между последовательными промывками составил 30 суток по 362 парам; при отбрасывании интервалов длиннее года медиана равна 21 суткам.

Панель признаков и разделение во времени

Признаков 38, они делятся на четыре группы. Режимные: дебиты нефти и жидкости, обводненность и ее скользящее среднее за три месяца, месячные отборы, часы работы, часы и доля простоя, пластовое и забойное давление, депрессия. Динамические: изменения дебитов и обводненности за один и за три месяца, отношение текущего дебита к максимуму за полгода. Исторические: число прошлых АСПО‑событий и ремонтов, время с последнего события, число промывок за 90 и 365 суток, время с последней промывки, накопленные отборы нефти и жидкости с момента последнего события, число остановок и суток простоя за 90 суток. Конструктивные и прочие: способ эксплуатации, число вскрытых объектов, факт гидроразрыва за 180 суток, плотность попутной воды, календарный месяц.

Признаки и целевая переменная разнесены во времени так, чтобы в расчет не могла попасть информация о самом событии. Схема разделения приведена на рисунке 2.

Рисунок 2. Разделение признаков и целевой переменной во времени

Точка прогноза совпадает с концом месяца. Признаки вычисляются только по данным, доступным на эту дату с учетом вычисления параметров в выбранном окне. Целевая переменная равна единице, если событие произошло в течение следующих 90 суток. Наблюдения того месяца, в котором событие уже случилось, в расчет признаков не входят, поэтому модель не может опереться на след самого ремонта. Такое разделение обязательно для задач с временной структурой [17, 18]; без него оценка качества характеризует не прогноз, а полноту описания прошлого.

Для признаков «время с последнего события» отсутствие события в истории кодируется отдельным двоичным признаком, а само время ограничивается сверху 730 сутками, чтобы бесконечность не превращалась в числовой выброс.

Способы ранжирования и метрики

Сопоставлены девять способов, объединенных в три группы. Первая группа воспроизводит то, чем задача решается без моделей: историческая частота событий на скважине, циклический показатель по времени с последней промывки и пороговое правило, суммирующее пять промысловых признаков (падение дебита относительно максимума за полгода, низкая обводненность, давно не промывали при наличии промывок в истории, были АСПО‑события, малый дебит жидкости). Правило составлено авторами по сложившейся практике и служит точкой отсчета, а не результатом опроса специалистов. Вторая группа: логистическая регрессия, случайный лес [14], градиентный бустинг. Третья: изолирующий лес как детектор аномалий без учителя, ансамбль из случайного леса и изолирующего леса по рангам, а также нейронная сеть.

Нейронная сеть представляет собой многослойный персептрон. Поскольку события редки и составляют около двух процентов наблюдений, обучающая выборка перед подачей в сеть уравновешена: наблюдения с событием продублированы до сопоставимой доли с наблюдениями без события. Без такого уравновешивания сеть сходится к постоянному ответу «события не будет».

Расчет выполнен средствами scikit‑learn [15]. Случайный лес обучался на 300 деревьях с минимумом восьми наблюдений в листе, долей признаков 0,5 и весами классов, обратными их частоте.

Проверка выполнена по времени, без перемешивания наблюдений [18]: обучение на данных до января 2025 г. (7364 наблюдения, 185 событий), проверка на последующих 14 месяцах (2002 наблюдения, 44 события, базовая частота 2,2 %). В остальных 98 % скважино‑месяцев осложнений не возникает, и задача сводится к поиску редких случаев на фоне штатно работающего фонда. Отбор параметров моделей на проверочном периоде не производился.

Использованы две метрики. Площадь под характеристической кривой (ROC‑AUC) характеризует ранжирование в целом: значение 0,5 отвечает случайному порядку, единица безошибочному ранжированию. Средняя точность равна площади под кривой «точность — полнота» и при сильном дисбалансе классов информативнее первой метрики [16]. Ее значения на таких данных малы по построению: при базовой частоте 2,2 % случайное ранжирование дает среднюю точность 0,022, и сравнивать полученные величины следует именно с этим уровнем, а не с единицей.

Результаты

Сопоставление способов ранжирования

Результаты приведены в таблице 2, кривые качества для представительных методов на рисунке 3.

Таблица 2. Качество ранжирования на проверочном периоде, горизонт 90 суток

Способ ранжирования

ROC-AUC

Средняя точность

Случайный лес

0,630

0,041

Ансамбль (лес и аномалии)

0,611

0,042

Нейронная сеть

0,721*

0,083

Градиентный бустинг

0,567

0,028

Изолирующий лес

0,560

0,028

Логистическая регрессия

0,540

0,050

Циклический показатель

0,461

0,022

Историческая частота

0,454

0,027

Пороговое правило

0,339

0,018

Случайное ранжирование (уровень отсчета)

0,500

0,022

* Приведен результат одного удачного запуска, см. пояснение ниже.

Рисунок 3. Кривые качества на проверочном периоде: характеристическая кривая

Первое наблюдение: способы, которыми фонд ранжируется без моделей, работают хуже случайного порядка. Пороговое правило дало 0,339, то есть систематически ставило вперед скважины, у которых событий не произошло. Историческая частота дала 0,454, циклический показатель 0,461. Все три величины ниже 0,5, и это устойчивый результат, а не особенность разбиения.

Второе наблюдение касается выбора рабочей модели. Формально лучший результат показала нейронная сеть, но он получен при одном значении начального состояния генератора случайных чисел. Повторение обучения при пяти разных значениях дало ROC-AUC 0,660 ± 0,042, то есть разброс между запусками одной и той же сети превышает ее отрыв от случайного леса. Случайный лес при тех же повторениях держится на 0,630 с разбросом менее 0,01. При 44 событиях на проверочном периоде воспроизводимость важнее среднего значения: рейтинг, который меняется при каждом переобучении, невозможно использовать в регламентной работе. По этой причине рабочей моделью выбран случайный лес, а результат нейронной сети сохранен в таблице как указание на возможный резерв качества при большем объеме размеченных данных.

Третье наблюдение: ансамбль с детектором аномалий дает близкое качество и другой состав верхней части рейтинга. Обе версии имеет смысл сохранять и сравнивать при опытной эксплуатации.

Информативные признаки

Значимость признаков оценена перестановочным методом на проверочном периоде по приросту средней точности, 30 перестановок на признак. Результат приведен на рисунке 4.

Рисунок 4. Значимость признаков случайного леса. Отрезки соответствуют стандартному отклонению по 30 перестановкам

Устойчиво значимыми оказались четыре признака, у которых оценка превышает удвоенное стандартное отклонение: способ эксплуатации, пластовое давление, накопленный отбор нефти с момента последнего события и депрессия. Остальные признаки, включая дебит жидкости и его динамику, значимы формально, но их доверительные интервалы пересекают ноль.

Состав первой четверки допускает физическое истолкование. Способ эксплуатации задает подачу и, через нее, скорость потока и время пребывания флюида в зоне охлаждения: штанговый насос работает при меньших подачах, чем электроцентробежный, и поток остывает сильнее на том же участке ствола. Исходя из пластового давления и депрессии формируется забойное давление, которое определяет глубину, где текущее давление в потоке становится ниже давления насыщения, что ведет к началу разгазирования с сопутствующим дроссельным охлаждением. Накопленный отбор нефти с момента последнего события ведет себя как счетчик поступившего к стенке парафина: чем больше нефти прошло с прошлой очистки, тем больше материала могло отложиться. Ни один из четырех признаков не был задан заранее как физически обоснованный, все они отобрались по данным.

Раннего падения дебита перед событием в месячных данных обнаружить не удалось. Медианная динамика режима в окне вокруг события не показывает систематического снижения подачи за один‑три месяца до ремонта. Признаки динамики дебита стоят ниже режимных и на рисунке 4, что согласуется с этим наблюдением: месячное осреднение, по‑видимому, сглаживает предвестники, если они есть.

Влияние горизонта прогноза

Горизонт в 90 суток выбран потому, что при более коротком горизонте событий остается слишком мало, а при более длинном прогноз теряет практический смысл. Результаты проверки на четырех горизонтах приведены в таблице 3.

Таблица 3. Качество случайного леса при разных горизонтах прогноза

Горизонт, сут.

События в обучении

События в проверке

Базовая частота, %

ROC-AUC

Средняя точность

30

69

16

0,8

0,591

0,014

60

129

30

1,5

0,624

0,029

90

185

44

2,2

0,638

0,040

180

343

81

4,1

0,622

0,085

Качество ранжирования почти не меняется при переходе от 60 к 180 суткам; наибольшее значение приходится на 90 суток. Средняя точность с ростом горизонта увеличивается, но только потому, что растет сама частота событий: отношение средней точности к базовой частоте остается примерно постоянным. На горизонте 30 суток результат заметно хуже, поскольку событий остается 16 и оценка становится неустойчивой.

Обсуждение

Полученная точность ранжирования невысока по меркам задач машинного обучения. Объяснение, которое согласуется со всеми наблюдениями сразу, состоит в том, что связь между физикой отложения и наблюдаемым ремонтом ослаблена самой профилактикой. Скважины промываются регулярно, медианный интервал между промывками около месяца, и большинство скважин, накопивших отложения, до ремонта не доходит. В целевую переменную попадают преимущественно случаи, когда профилактика не сработала или запоздала, а это зависит не только от состояния скважины, но и от организации работ. Тот же механизм объясняет, почему циклический показатель по времени с последней промывки дал 0,461: скважины, которые давно не промывали, чаще всего давно не промывали потому, что они в этом не нуждаются.

Из этого следует практическое ограничение. Метод оценивает риск того, что скважина потребует внепланового вмешательства при сложившемся режиме профилактики, а не интенсивность отложения как физическую величину. Как только режим профилактики меняется, модель требует переобучения. Обратная сторона того же свойства: рейтинг непосредственно отвечает на вопрос, который стоит перед службой, поскольку обучен на ее собственных решениях.

Рейтинг не заменяет решение технолога и не предполагает его пересмотра. Он обучен на решениях самой службы, то есть на том, какие скважины и когда брали на промывку и на ремонт, и переводит этот опыт в форму, пригодную для ежемесячной сортировки фонда. Польза от него возникает там, где скважин больше, чем бригад, и очередность приходится назначать при неполной информации.

Сопоставление с физическим направлением работ уместно провести здесь же. Расчет сужения трубопровода по локальным температуре, фазовым расходам и скорости дает толщину слоя и эффективный диаметр, замкнутые обратной связью с гидравликой сети. Такой расчет объясняет механизм, но требует калибровки по фактическим замерам, которых нет. Рейтинг риска, наоборот, ничего не объясняет и настраивается по имеющейся истории. Два подхода не конкурируют: рейтинг отбирает участки, на которых физический расчет имеет смысл выполнять и на которых стоит организовать замеры для его настройки.

Границы применимости очерчиваются пятью обстоятельствами. Разметка слабая: явное упоминание парафина встречается в 10 записях из 325, остальные отнесены к АСПО по формулировкам, допускающим иные причины. Событий мало: 44 на проверочном периоде, и доверительные интервалы обеих метрик широки. Покрытие неравномерное: журнал остановок ведется с 2023 г., поэтому обучение фактически опирается на два года из шести. Осреднение месячное, тогда как процесс развивается за недели, и суточная телеметрия могла бы дать предвестники, которых в месячных данных нет. Фонд один: перенос на другой цех с иной нефтью и иным регламентом профилактики требует повторного обучения и повторной проверки.

Направление дальнейших работ определяется этими ограничениями. Первоочередным представляется переход на суточные данные по тем скважинам, где они доступны, поскольку это единственная из пяти причин, устранимая без изменения организации работ. Далее следует проверка рейтинга в опережающем режиме: список формируется на будущий месяц и сопоставляется с фактом, что дает оценку, свободную от любых сомнений в чистоте разбиения. Наконец, представляет интерес связка с физическим расчетом, при которой рейтинг задает участки для замеров, а замеры настраивают кинетические коэффициенты модели отложения.

Заключение

  1. По ремонтной и режимной истории 170 скважин построен рейтинг риска АСПО‑осложнений с горизонтом 90 суток. Целевым событием служит ремонт или отказ с косвенными признаками отложений, разметка получена по словарю причин и включает 325 событий.

  2. Рабочей моделью выбран случайный лес с ROC‑AUC 0,630 при проверке по времени. Выбор сделан в пользу воспроизводимости: нейронная сеть дает более высокое среднее значение 0,660, но с разбросом ±0,042 между запусками, тогда как разброс случайного леса не превышает 0,01.

  3. Способы ранжирования, применяемые без моделей, оказались хуже случайного порядка: пороговое правило дало ROC‑AUC 0,339, историческая частота 0,454, циклический показатель по времени с последней промывки 0,461.

  4. Устойчиво информативными оказались четыре признака: способ эксплуатации, пластовое давление, накопленный отбор нефти с момента последнего события и депрессия. Все четыре допускают физическое истолкование через работу насоса, глубину начала разгазирования и количество прошедшей через скважину нефти.

  5. Раннего падения дебита перед событием в месячных данных не обнаружено. Строгая разметка по явному упоминанию парафина дает 12 событий за шесть лет, чего для обучения недостаточно.

  6. Метод оценивает риск внепланового вмешательства при сложившемся режиме профилактики, а не интенсивность отложения. Он применим для очередности профилактических работ и для отбора участков под физический расчет и замеры, но не заменяет ни лабораторное определение, ни термодинамическую модель.

1. Tronov V. P. Mekhanizm obrazovaniya smoloparafinovykh otlozhenii i borba s nimi [Mechanism of resin and paraffin deposit formation and its control] / Tronov V. P. — Moscow: Nedra Publ., 1970 (In Russ.).

2. Ivanova L. V. Asphaltene, resin and paraffin deposits in oil production, transportation and storage / Ivanova L. V., Burov E. A., Koshelev V. N. // Neftegazovoe delo. — 2011. — № 1. — Pp. 268–284 (In Russ.).

3. Valeev A. R. Direct and indirect methods for determining the amount of paraffin deposits in an oil pipeline / Valeev A. R., Girfanova D. Yu. // Neftegazovoe delo. — 2013. — Vol. 11. — № 4. — Pp. 110–114 (In Russ.).

4. Aiyejina A. Wax formation in oil pipelines: a critical review / Aiyejina A., Chakrabarti D. P., Pilgrim A., Sastry M. K. S. // International Journal of Multiphase Flow. — 2011. — Vol. 37. — № 7. — P. 671–694. — https://doi.org/10.1016/j.ijmultiphaseflow.2011.02.007

5. Kiyingi W. Crude oil wax: a review on formation, experimentation, prediction, and remediation techniques / Kiyingi W., Guo J.-X., Xiong R.-Y., Su L., Yang X.-H., Zhang S.-L. // Petroleum Science. — 2022. — Vol. 19. — № 5. — P. 2343–2357. — https://doi.org/10.1016/j.petsci.2022.08.008

6. Burger E. D. Studies of wax deposition in the Trans Alaska pipeline / Burger E. D., Perkins T. K., Striegler J. H. // Journal of Petroleum Technology. — 1981. — Vol. 33. — № 6. — P. 1075–1086. — https://doi.org/https://doi.org/10.2118/8788-PA

7. Singh P. Formation and aging of incipient thin film wax-oil gels / Singh P., Venkatesan R., Fogler H.S., Nagarajan N. // AIChE Journal. — 2000. — Vol. 46. — № 5. — P. 1059–1074. — https://doi.org/10.1002/aic.690460517

8. Matzain A. Investigation of paraffin deposition during multiphase flow in pipelines and wellbores. Part 1: experiments / Matzain A., Apte M. S., Zhang H.-Q., Volk M., Brill J. P., Creek J. L. // Journal of Energy Resources Technology. — 2002. — Vol. 124. — № 3. — P. 180–187. — https://doi.org/10.1115/1.1484392

9. Edmonds B. Simulating wax deposition in pipelines for flow assurance / Edmonds B., Moorwood T., Szczepanski R., Zhang X. // Energy & Fuels. — 2008. — Vol. 22. — № 2. — P. 729–741. — https://doi.org/10.1021/ef700434h

10. Pedersen K. S. Wax precipitation from North Sea crude oils. 4. Thermodynamic modeling / Pedersen K. S., Skovborg P., Rønningsen H. P. // Energy & Fuels. — 1991. — Vol. 5. — № 6. — P. 924–932. — https://doi.org/10.1021/ef00030a022

11. de Boer R. B. Screening of crude oils for asphalt precipitation: theory, practice, and the selection of inhibitors / de Boer R. B., Leerlooyer K., van Bergen A. R. D., Eigner M. R. P. // SPE Production & Facilities. — 1995. — Vol. 10. — № 1. — P. 55–61. — https://doi.org/10.2118/24987-PA

12. Mohammed I. Asphaltene precipitation and deposition: a critical review / Mohammed I., Mahmoud M., Al Shehri D., El-Husseiny A., Alade O. // Journal of Petroleum Science and Engineering. — 2021. — Vol. 197. — Art. 107956. — https://doi.org/10.1016/j.petrol.2020.107956

13. ASTM D8420-21. Standard test method for wax appearance temperature and wax disappearance temperature of petroleum products and liquid fuels. West Conshohocken: ASTM International, 2021. — 8 p.

14. Breiman L. Random forests / Breiman L. // Machine Learning. — 2001. — Vol. 45. — № 1. — P. 5–32. — https://doi.org/10.1023/A:1010933404324

15. Pedregosa F. Scikit-learn: machine learning in Python / Pedregosa F., Varoquaux G., Gramfort A. [et al.] // Journal of Machine Learning Research. — 2011. — Vol. 12. — P. 2825–2830.

16. Saito T. The precision-recall plot is more informative than the ROC plot when evaluating binary classifiers on imbalanced datasets / Saito T., Rehmsmeier M. // PLoS ONE. — 2015. — Vol. 10. — № 3. — Art. e0118432. — https://doi.org/10.1371/journal.pone.0118432

17. Kaufman S. Leakage in data mining: formulation, detection, and avoidance / Kaufman S., Rosset S., Perlich C., Stitelman O. // ACM Transactions on Knowledge Discovery from Data. — 2012. — Vol. 6. — № 4. — Art. 15. — https://doi.org/10.1145/2382577.2382579

18. Cerqueira V. Evaluating time series forecasting models: an empirical study on performance estimation methods / Cerqueira V., Torgo L., Mozetič I. // Machine Learning. — 2020. — Vol. 109. — № 11. — P. 1997–2028. — https://doi.org/10.1007/s10994-020-05910-7

19. Ratner B. The correlation coefficient: its values range between +1/−1, or do they? / Ratner B. // Journal of Targeting, Measurement and Analysis for Marketing. — 2009. — Vol. 17. — № 2. — P. 139–142. — https://doi.org/10.1057/jt.2009.5

20. Liu Y. Non-ferrous metals price forecasting based on variational mode decomposition and LSTM network / Liu Y., Yang C., Huang K., Gui W. // Knowledge-Based Systems. — 2020. — Vol. 188. — Art. 105006. — https://doi.org/10.1016/j.knosys.2019.105006

21. Zhu H.-J. Machine learning for predicting wax deposition rate in crude oil pipelines / Zhu H.-J., Liu Y., Han S. [et al.] // ACS Omega. — 2023. — Vol. 8. — № 34. — P. 31085–31099. — https://doi.org/10.1021/acsomega.3c03021

22. Gadelshin I. I. Issledovanie effektivnosti perspektivnykh tekhnologii preduprezhdeniya i opredeleniya naibolee optimalnykh metodik borby s obrazovaniem ASPO v truboprovodnykh setyakh: master thesis / Gadelshin I. I. — Almetyevsk, AGNI, 2025 (In Russ.).