#инфраструктура

17 постов
пост №2084Разработка и инженерия

В Германии уже третий час не ходят поезда, упала специальная сотовая сеть GSM-R, которая поддерживает связь между машинистами и диспетчерами и обмен технической информацией между поездами. Чтобы не было столкновений, все поезда встали.

На немецком ЖД-реддите ходят слухи, что причина в кривом обновлении софта.

Я и не знал, что у поездов есть своя сотовая сеть из 90-х. У нас уже 5G, а поезда на 2G.

Вообще, в этом вся суть инфраструктуры: пока всё работает — никто не замечает. Я восхищаюсь инфраструктурой, и чем более базовая — тем круче. Надеюсь, когда-нибудь возьму интервью у инженера, который занимается водопроводом и канализацией.

P. S. Недавно узнал, как работали римские акведуки. Там, оказывается, вода становилась чистая за счет точно рассчитанного наклона трубы; вода течет медленно и вся грязь оседает, но и не слишком медленно, чтобы не застаивалась. 🪄

пост №2062Разработка и инженерия

Гитхаб в последнее время сильно сбоит.

В дополнение к инциденту с merge queue, за последние дни успели сломаться поиск и показ пул-реквестов.

Техдир сервиса Владимир Федоров в своем покаянном посте пишет, что причина — во взрывном росте активности на платформе из-за нейросетей (см картинку).

Обещает, что теперь они будут работать над стабильностью, масштабируемость и перестанут гнаться за фичами.

Внешние наблюдатели подозревают две причины: 1) плохой вайбкодинг в Microsoft 2) сложный переезд с собственной инфраструктуры на Azure.

И вот уже знаменитый Митчел Хашимото пишет длинный эмоциональный пост, что уносит репозиторий своего проекта ghostty с гитхаба.

Создать git репозиторий можно без всяких сервисов — это просто файлы на диске. Гитхаб выигрывает за счет удобного контроля доступа, интеграции с ci/cd инструментами, удобного веб-интерфейса для комментирования и тысячи мелочей.

Есть десятки конкурентов, но ни один не дотягивает до качества github. Раньше это был «лучший инструмент, который можно купить за деньги», а теперь он становится одним из многих, со своими плюсами и минусами. Прямо падение гиганта.

Конечно, у таких сервисов огромная инерция, но очень интересно, куда побегут «модные ребята», которые задают тренды. Будет ли это новый классический конкурент со взрывным ростом или что-то распределенное и децентрализованное, соответствующее базовой философии гита?

пост №1911Управление и команды

Впервые столкнулся с тем, что технический директор после начала аудита взял больничный и перестал отвечать на звонки генерального, а сисадмины не отвечают на письма. Никаких доступов к системе не предоставляют. Бизнес по сути потерял контроль над своей собственной инфраструктурой. Надеюсь, хоть информацию на дисках не потрут и сайт не дефейснут.

Вроде и рабочие моменты, а все равно тревожно за клиента. И чувство, будто подошел к краю бездны, которую обычно в жизни обхожу стороной.

Я сначала написал: «а вот если бы у финдира в сейфе в запечатанном конверте были бы ключи доступа и инструкция по входу…».

Но это попытка вернуть иллюзию контроля. Мол, «вот если бы это сделали — то не оказались бы в подобной ситуации».

Кажется, что решение этой задачи лежит не в технической плоскости. А может быть, это и вовсе не задача — быть может, честнее признать, что все мы изредка попадаем в очень неприятные ситуации. Ну кроме тех, кто вообще не живет.

пост №1850Разработка и инженерия

В 21:46 мск отказала большая часть гугловского облака GCP. Ходят слухи, что всё из-за одного ключевого технического внутреннего сервиса, но в результате в разной степени поломались гугловские продукты, вроде Cloud, Drive, Meet, Gmail.

Предположительно, из-за этого начал глючить Cloudflare, один из самых популярных CDN-провайдеров.

Дальше по цепочке легла половина интернета — Spotify, Discord, Snapchat и тысячи других. Особенно тревожно, что для многих людей сломался RCS — это протокол, продвигаемый Гуглом, который должен заменить смски.

Предвкушаю увлекательные постмортемы от Гугла и Cloudflare, последние уж точно не упустят шанса рассказать, что это было.

В тысячах инженерных команд по всему мира сейчас была жара — все тушили пожары. А завтра все сядут составлять списки, что нужно поменять, чтобы в следующий раз было не так больно. Так и живем.

P. S. Про одновременное падение Amazon Web Services — кажется дезинформация.

пост №1647Разработка и инженерия

Почта России у меня ассоциируется с очередями в отделениях и потерянными посылками. В новом эпизоде подкаста разбираемся, насколько это близко к реальности с техническим директором Почтатеха Николаем Кнышем.

А ещё внутри Коля рассказывает, как они обрабатывают полтора миллиона посылок в день и при этом раскатывают софт на 300 тысяч сотрудников в 12 часовых поясах. 🤯

Слушайте и подписывайтесь: Apple, Google, Яндекс, Spotify, Castbox, Overcast, веб-версия.

пост №1518Бизнес и стартапы

Продаю классный VPN для бизнеса за 300 тысяч рублей в год.

Вы получите свой собственный сервер в Европе, который выдерживает больше тысячи одновременных пользователей для работы и несколько сотен — для ютуба с высоким разрешением. Никаких блокировок, никаких дополнительных платежей.

Работает VPN на Windows, Mac, Linux, телефонах и планшетах Android и iOS, программа устанавливается по ссылке, справится каждый.

У вас будет панель управления, в которой вы сможете сами создать/удалить ключи доступа и раздать их друзьями и коллегам. Подсмотреть, кто что смотрит в интернете — не получится, нет такой технической возможности. Администратору виден только объем переданной информации, тревожные коллеги могут спать спокойно.

Ограничение на объем переданных данных — 20 терабайт в месяц. Чтобы использовать весь этот объем, нужно 12 людям непрерывно весь месяц смотреть ютуб в высоком разрешении или 180 людям — по 2 часа каждый день. В общем, это — много, практически неограниченно.

Сервер базируется на технологии Shadowsocks, которую разработали специально для обхода великого китайского файрвола, технически его не засечешь. Роскомнадзор может начать блокировать популярные VPN-сервисы зная их адреса, но про этот сервер будете знать только вы и ваши коллеги.

Стоит такой сервер 300 тысяч рублей за год, доступ предоставлю в течении пары часов после оплаты. Пишите мне в личку @samatg в телеграме, постараюсь ответить оперативно. Предложение ограничено.

пост №1515Разработка и инженерия

А вот и сочные инсайды подтянулись! Спасибо дорогому читателю.

Вайлдбериз взломали русские хакеры и уничтожили почти всю инфраструктуру, включая бэкапы. Фронтенд есть, а бэкенда у них больше нет. Данные зашифрованы.

Скорее всего, во взломе участвовали внутренние «крысы», потому что, судя по рассказам, в целом про безопасность там думали.

Интересно, будут ли хакеры просить выкуп или это политическая акция.

Жаль, что подробностей от компании, мы, видимо, не услышим :(

пост №1355Разработка и инженерия

Клиент поделился, что у них в дата-центре выбило электричество, а дизель-генератор выключился из-за жары. Результат — серьезный простой продакшена. Всё бы ничего, но это клиент, у которого я только что закончил аудит и на то, что у них свой ДЦ я достаточного внимания не обратил 🙈

ОК, добавляем пункт «аудит ДЦ, если он не дай бог не Tier 3» в чеклист.

Чеклист аудита написан деньгами, прямо как техника безопасности — кровью.

пост №1202Разработка и инженерия

Амазон анонсировал сервис для «chaos engineering» в своем облаке AWS. Система выключает случайные части инфраструктуры для того, чтобы проверить, как ваш сервис умеет противостоять реальным авариям.

В яндексе эта штука называется «учения», когда могут, например, выключить целиком какой-то датацентр и проверить, как разные сервисы продолжают работать в такой ситуации. Или выключить какой-то кабель, который соединяет два разных ДЦ, чтобы симулировать обрыв кабеля.

Этот подход сильно популизировал Нетфликс. В 2011 году они переехали в облако и тогда же анонсировали «chaos monkey» — «обезьяну хаоса», которая выключала (убивала) случайные продакшен серверы компании. Идея в том, что на определенном объеме серверов подобные проблемы неизбежны. Это не вопрос «сломается ли», а вопрос «когда сломается» и «сколько сломается». И лучше подготовиться и протестировать свои подходы и инструменты заранее.

Амазон предлагает и вариант с «днями учений» и автоматическую проверку системы при деплоях. Тот случай, когда придуманные гигантами технологии потихоньку просачиваются в повседневность.

Напомню, для небольших компаний гораздо важнее настроить и проверить бэкапы.

пост №761Интернет и платформы

Пока московская часовая зона спала, ютуб успел полежать с 4:41 до 6 утра — 1ч и 21м, если верить официальному аккаунту. Никогда такого не видел. Интересно узнать, что у них там случилось; пока подробностей 0. Если бы был такой тотализатор — я бы поставил на то, что опять сеть упала из-за ошибок конфигурации.