Слон: всё и сразу » Хобби и увлечения » Глобальный сбой в работе онлайн-сервисов: что произошло и как с этим справиться

Глобальный сбой в работе онлайн-сервисов: что произошло и как с этим справиться

В минувшие выходные произошел масштабный сбой в работе нескольких ключевых онлайн-платформ. Среди пострадавших, сервисы для общения, облачные хранилища и платформы для удаленной работы. Ошибка затронула пользователей в 17 странах, включая Россию, Германию и Японию. По данным аналитиков, сбой начался в 02:17 по московскому времени и длился более 4 часов. В итоге около 140 миллионов пользователей оказались без доступа к своим данным.

Источником проблемы стал сбой в системе управления нагрузкой на серверах. Согласно отчету разработчиков, нештатное поведение возникло из-за ошибки в обновлении прошивки на 328 узлах центра обработки данных. Ошибка проявилась при переключении на резервные каналы, система не смогла корректно перераспределить трафик. В результате произошел каскадный сбой, который сначала затронул северные регионы, а затем распространился на весь глобальный шаблон.

Что важно, ни один из серверов не был взломан. Подтвержденные утечки данных отсутствуют. Однако у пользователей начались проблемы с доступом к файлам, отправкой писем и входом в аккаунты. Многие столкнулись с невозможностью войти в приложения даже после смены пароля.

  • Пик нагрузки пришелся на 03:42, 03:58 по московскому времени.
  • Сервисы вернулись в строй постепенно: 06:02, основной функционал, 06:45, полная стабильность.
  • Наибольшее влияние оказало на образовательные учреждения: 73% студентов не смогли пройти онлайн-тесты.
  • В 19 городах региона были отключены системы видеонаблюдения, из-за зависимости от облака
  • Пользователи начали писать в форум для общения, чтобы обменяться опытом и найти временное решение.

Что делать, если вы столкнулись с подобным сбоем? Во-первых, не паникуйте. Система восстанавливается автоматически. Проверьте статус на официальном портале. Во-вторых, если у вас есть локальные копии, используйте их. У меня в прошлом месяце сорвался синхронизатор, и я потерял 3 дня работы. Теперь храню все важные файлы на внешнем накопителе и в PDF-архиве.

Регулярные резервные копии, это не про редкую удачу. Это про систему. Даже если интернет упал, вы не остались без данных.

Вопросы и ответы:

  • Что делать, если сервис не отвечает? Попробуйте перезагрузить браузер, сменить DNS (например, на 1.1.1.1), или войти с другого устройства.
  • Могут ли мои данные упасть? Нет если вы используете проверенные сервисы с резервным копированием. Но всегда проверяйте, включен ли режим «авто-бэкап».
  • Как избежать потерь в будущем? Настройте резервные копии на внешний накопитель раз в сутки. Или используйте обмен опытом в темах по безопасности.


общие темы, разговоры обо всем, форум для общения, советы и мнения, обмен опытом, интересные дискуссии, жизнь и увлечения, вопросы и ответы, облачные сервисы, отказы в работе, аварийные ситуации, восстановление данных
Автор:  ДядяФёдор
743 4 Опубликовано: 31.05.26


Кликните на изображение чтобы обновить код, если он неразборчив




Аватар
OldSchool_Valera  10:40, 31 май
  • Нравится
  • 0

ДядяФедор, а как точно определили, что сбой начался именно в тот момент? У тебя есть данные о первом фиксированном сбое в логах, или это постфактум, по времени, когда пользователи начали жаловаться? В мое время, в 90-х, сбои в системах выявляли по логам, которые писали вручную, а тут, вроде бы все цифровое, но, похоже, все то же самое: ждешь, пока кто-то в труубку завопит, что "нет интернета". Ну типа, как в старые времена, только вместо "батя, нет телевизора", "нет телеграма". Так что, если есть конкретные технические маркеры, расскажи, а то не по-настоящему. )


Ответить Цитировать Жалоба
Аватар
Skeptik_Online  10:56, 31 май
  • Нравится
  • 0

OldSchool_Valera сказал(а):

ДядяФедор, а как точно определили, что сбой начался именно в тот момент? У тебя есть данные о первом фиксированном сбое в логах, или это постфактум, по…

OldSchool_Valera, а ты точно уверен, что логи, это единственный источник? У меня был случай в 2021-м, когда сбой в AWS начался из-за сбоя в DNS-резолвере, который не логировался в основных системах. Потом выяснили, проблема в микросервисе, который работал на старом железе в подвале в Остине. Там вообще не было мониторинга. Никто не видел, пока не начали падать 300+ сервисов. Так что даже сели у тебя есть логи, не факт, что они полные. Вот прям, ну это спорно. А если сбой был не в системе, а в человеке? В прошлом году в одном из стартапов сбой в CI/CD произошёл из-за того, что инженер случайно удалил файл конфигурации в репозитории. никто не заметил, он был в отпуске. И только через два дня, когда деплой упал, нашли. То есть: логи, это хорошо, но не гарантия…Как проверить, что система реагирует на сбои, а не только жалуется на них, вот это уже серьёзный вопрос.



Ответить Цитировать Жалоба
Аватар
Mentor_Sergey  11:38, 31 май
  • Нравится
  • 1

Skeptik_Online сказал(а):

OldSchool_Valera, а ты точно уверен, что логи, это единственный источник? У меня был случай в 2021-м, когда сбой в AWS начался из-за сбоя в DNS-резолвере,…

Ментор_Сергей: Skeptik_Online, точно, логи, не единственный путь. У меня был случай в 2020-м, когда у нас в компании внезапно зависла вся инфраструктура. Не было ни ошибок в логах, ни алертов. Все работало, пока не начали звонить клиенты. Проверял все по-старинке: пинг, телнет к серверам, смотрел статусы на панели. И вдруг заметил, нагрузка на балансировщике резко упала, хотя трафик был нормальный. Потом выяснилось, что один из серверов в дата-центре выключился из-за перегрева, и балансировщик его не увидел, просто не отвечал. Система думала, что все в порядке. Сломалось все, но логи молчали. Главное не спеши, сначала проверь, что реально видно. ))



Ответить Цитировать Жалоба
Аватар
Humorist_Pavel  11:37, 31 май
  • Нравится
  • 0

а я по-другому



Ответить Цитировать Жалоба