СОЗДАНИЕ WEB-ИНТЕРФЕЙСА ДЛЯ МОНИТОРИНГА СОСТОЯНИЯ ВЫЧИСЛИТЕЛЬНЫХ КЛАСТЕРОВ
Аннотация и ключевые слова
Аннотация:
В работе рассматривается разработка легковесного веб-интерфейса для мониторинга состояния вычислительных кластеров, функционирующих под управлением специализированной системы управления очередями задач. Актуальность решения обусловлена необходимостью простого и эффективного инструмента для оперативного контроля за распределенными вычислительными ресурсами в научно-образовательной среде, где зачастую используются разнородные и маломощные системы. Представлена архитектура решения, основанная на анализе текстовых файлов статистики и их автоматической трансформации в HTML-страницы. Система построена на использовании скриптов Bash и Python, что обеспечивает минимальные зависимости и простоту развертывания. Описаны основные функциональные возможности системы, включая отображение текущей очереди задач, мониторинг загрузки вычислительных узлов (процессоры, память), детектирование сбоев на основе анализа временных меток и формирование истории выполненных заданий. Особое внимание уделено методам обработки временных меток для обеспечения корректного расчета времени выполнения задач и алгоритмам обеспечения кроссплатформенной совместимости (Linux, Windows). Разработанное решение прошло успешную апробацию в реальных эксплуатационных условиях и демонстрирует устойчивую работу в течение пяти лет на нескольких вычислительных кластерах. Приведены результаты тестирования системы, подтверждающие ее высокую эффективность: время генерации страницы для кластера из 10 узлов составляет менее 1 секунды, точность детектирования сбоев достигает 98%, а надежность за период эксплуатации оценена в 99,8%. Ключевыми преимуществами системы являются низкие требования к вычислительным ресурсам, простота развертывания, адаптивный дизайн для мобильных устройств и поддержка многокластерной архитектуры, что делает ее особенно привлекательной для образовательных учреждений и небольших научных групп.

Ключевые слова:
WЕБ-ИНТЕРФЕЙС, МОНИТОРИНГ, ВЫЧИСЛИТЕЛЬНЫЙ КЛАСТЕР, СИСТЕМА УПРАВЛЕНИЯ ОЧЕРЕДЯМИ, PBS, PYTHON, HTML, РАСПРЕДЕЛЕННЫЕ ВЫЧИСЛЕНИЯ, ВЫСОКОПРОИЗВОДИТЕЛЬНЫЕ ВЫЧИСЛЕНИЯ, ЭНЕРГОЭФФЕКТИВНОСТЬ
Список литературы

1. Gentzsch W. Sun Grid Engine: Towards Creating a Compute Power Grid. Proceedings of the 1st International Symposium on Cluster Computing and the Grid, 2001, pp. 35-36.

2. Журавлев С. С., Рудометов С. В., Окольнишников В. В., Шакиров С. Р. Применение модельно-ориентированного проектирования к созданию АСУ ТП опасных промышленных, объектов. Вестник НГУ. Серия: Информационные технологии, 2018, т. 16, № 4, с. 56-67. DOIhttps://doi.org/10.25205/1818-7900-2018-16-4-56-67.

3. Altair Engineering PBS Professional 2022 User's Guide. 2022, 284 p.

4. DeLeon R. L., Furlani T. R., Gallo S. M., et al. XDMoD: A Tool for Comprehensive System Monitoring and Performance Analysis of High Performance Computing Centers. Proceedings of the 2015 Winter Simulation Conference, 2015, pp. 3233-3244. DOIhttps://doi.org/10.1109/WSC.2015.7408425.

5. Staples G. TORQUE Resource Manager. Proceedings of the 2006 ACM/IEEE conference on Supercomputing, 2006, p. 8-es. DOIhttps://doi.org/10.1109/SC.2006.21.

6. Henderson R. L. Job Scheduling Under the Portable Batch System. Job Scheduling Strategies for Parallel Processing, 1995, vol. 949, pp. 1-6.

7. IBM Platform Computing. IBM Platform LSF. [Электронный ресурс]. URL: https://www.ibm.com/products/hpc-workloadmanagement (дата обращения: 15.10.2023).

8. TORQUE Resource Manager. [Электронный ресурс]. URL: http://www.adaptivecomputing.com/products/torque/ (дата обращения: 15.10.2023).

9. Jette M., Yoo A., Grondona M. SLURM: Simple Linux Utility for Resource Management. Proceedings of the 2002 Cluster World Conference, 2002.

10. Thain D., Tannenbaum T., Livny M. Distributed Computing in Practice: The Condor Experience. Concurrency and Computation: Practice and Experience, 2005, vol. 17, no. 2-4, pp. 323-356.

11. Massie M., Chun B., Culler D. The Ganglia Distributed Monitoring System: Design, Implementation, and Experience. Parallel Computing, 2004, vol. 30, no. 7, pp. 817-840.

12. Barth W. Nagios: System and Network Monitoring. 2nd ed. No Starch Press, 2008.

13. Zabbix LLC. Zabbix Documentation. [Электронный ресурс]. URL: https://www.zabbix.com/documentation/ (дата обращения: 15.10.2023).

14. Grafana Labs. Grafana Documentation. [Электронный ресурс]. URL: https://grafana.com/docs/ (дата обращения: 15.10.2023).

15. Elasticsearch B.V. Kibana Guide. [Электронный ресурс]. URL: https://www.elastic.co/guide/en/kibana/current/index.html (дата обращения: 15.10.2023).

16. Маслий А.А. Создание web-интерфейса для мониторинга состояния вычислительных кластеров. В сборнике: Инженерная мысль. сборник докладов II Республиканской научно-практической конференции. Казань, 2024. С. 62-64.

Войти или Создать
* Забыли пароль?