Buildkite サービス障害
9月10日 01:54 UTC 解決しました - 20時28分以降、顧客が完全に回復しました。自動スケーリングのフィードバックループを経験し 応答能力を超えた 接続数を増やしましたこれは Web UI,エージェント API,REST API と 18時43分~19時21分 UTC の間、また 20時02分~20時28分 UTC の間、すべての顧客に広範な影響を及ぼしました。完全なポ。..
9月10日 01:54 UTC 解決しました - 20時28分以降、顧客が完全に回復しました。自動スケーリングのフィードバックループを経験し 応答能力を超えた 接続数を増やしましたこれは Web UI,エージェント API,REST API と 18時43分~19時21分 UTC の間、また 20時02分~20時28分 UTC の間、すべての顧客に広範な影響を及ぼしました。完全なポ。..
ホストされたエージェントで実行されている仕事は、すぐに送信されます。監視 - 緩和措置を講じ、ホストされたエージェント全体で回復を観察しました。我々は監視を続けます7月4日 01:42 UTC調査 - 宿主エージェントの遅延とエラー率が増加しています。現在調査中です 状況更新は。..
7月4日 01:40 UTC調査 - 顧客の一部で遅延とエラー率が増加しています現在調査中です 状況が更新され次第 報告します
7月3日 07:06 UTC 解決 - ホストされたエージェントで実行されている仕事は、すぐに送信されます。7月3日 06:44 UTCモニタリング - 宿主職のスケジューリング率が回復しています仕事が進めるはずだが 遅延があるかもしれない7月3日 06:09 UTC更新 - 宿主エージェントへのいくつかの仕事派遣はタイムアウトしており、仕事が遅くなっています。現在調査中です
9月2日 15:51 UTC 解決しました - ホストエージェントの派遣はもう遅延していません。7月2日 15:43 UTCモニタリング - 遅れた仕事やモニタリングの処理を継続しています。9月2日 15:29 UTC 確認 - 宿主エージェントの派遣が遅れて回復が始まっています現在 遅れている作業を 処理しています7月2日 15:16 UTC更新 - オ。..
9月1日 16:52 UTC 解決しました - 送信中のメールの配線はメール通知は成功しました。7月1日16時38分 UTCモニタリング - メールの配達が成功し、出荷メールの処理を監視しています。9月1日16時19分 UTC更新 - 担当エンジニアは 代替的なアップストリームメールへの 移行に取り組んでいます
8月27日 11:47 UTC 解決 - アップロードされたテスト実行データの処理が正常に戻りました。8月27日 11:23 UTC更新 - 追いつく処理が継続し、残された大部分が処理され、摂取遅延が減少しています。8月27日 10:56 UTCモニタリング - アップロードされたテスト実行データの内部処理が遅れており、現在追いついています。データは漏れていません
8月26日 03:13 UTC 解決 - 緩和戦略は予想通り機能し、現在代理人の登録は正常に戻りました。すべてのシステムは安定している。回復が進行中です。 回復が完了するまで監視を続けます。根本的な問題を解決するためにいくつかの変更を展開し、回復の兆候が見られます。
8月26日 00:18 UTC 解決しました8月25日 23:38 UTCモニタリング - システムは回復し、新しいビルドが作成されています。内部 DNS サービスが故障したため、新しいビルドは作成できませんでした。この間、ビルドの要求はなく、 処理が続いています。
8月25日 08:16 UTC 解決 - この事件は解決されました。8月25日 07:42 UTC更新 - エージェント接続が回復しましたが、一部のエージェントは、以前の強制的な接続切断後に自動的に再接続していません。 エージェントを再接続するためにエージェントサービスを再起動することをお勧めします。06:04 UTCに 欠陥のリクエストを ≪agent-edge.buildkite.com≫に変更しました
8月17日 02:43 UTC 解決 - この事件は解決しました。8月17日 02:00 UTCモニタリング - 我々はすべてのバックグラウンドワーカーが13時13分まで追いついたことを確認しました。ホストエージェントの配送は 正常に戻ったサービスを監視し、残った再試みを確認します。遅延が高まっていると。..
8月13日 16:40 UTC 解決しました - 問題の影響が終わったと思います。8月13日 16:29 UTCモニタリング - 問題を解決しました改善の兆しが見られます8月13日 16:14 UTC 特定 - 問題の原因を特定し 積極的に緩和しています- 何かおかしいことが 分かりました
8月12日 04:08 UTC 解決しました - 過去1週間、新しいEKSインフラストラクチャで運行されているエージェントトラフィックを内部でテストしてきました。2026年8月11日23時01分に ルーティングを開始しました
8月11日 02:04 UTC 解決 - この事件は解決されました。8月11日 01:04 UTC更新 - パイプラインとテストエンジンとの統合が再有効化され、ビルドページのテストタブが復元されました。統合が安定していることを確認するために 回復を監視していますテスト結果は テストエンジンから直接入手できますパイプラインとの統合。..
8月5日 22:00 UTC 解決 - 22:03 - 22:16 UTC 間に、顧客は仕事派遣、ビルド処理、通知が遅れた。さらに、この期間中にウェブフックを受信するエラーがありました。
8月3日 05:36 UTC 解決しました 事故の影響が全て解決しました8月3日 05:29 UTCモニタリング - 修正は完全に展開され 回復の兆候が見られますこの問題によって影響を受けるすべてのイベントは 自動的に再試行されます。安定の修正を 監視し続けています8月3日 05:22 UTC更新 - 衝撃がより広範囲に広がっていることを確認しました
7月28日 20:57 UTC 解決 - 影響を受けた断片の通知遅延は 5秒未満です7月28日 20:38 UTC 特定 - 建設の遅延と 顧客の一部の仕事に関する通知を調査しています
06月18日 09:43 UTC 解決しました - サービスが完全に回復しました6月18日 09:17 UTCモニタリング - 修正が実施され、サービスが回復しています。問題を確認し 修正を進めています影響は利用者のサブセットのための API を作成するビルドに限定されます。6月18日 08:05 UTC 確認 - 遅延とエラー率が増加している
6月12日 00:16 UTC 解決 - 最後の更新前に適用された緩和措置が意図された効果をもたらし、REST APIの遅延の回復が見られました。6月11日 23:51 UTC更新 - REST API サービスに高い負荷が原因で問題を解消しましたエージェントとスタック API は影響を受けませんREST APIの負荷が上昇した
6月11日 00:51 UTC 解決 - 00:05 - 00:34 UTCの間、一部の顧客は Agent API の遅延とタイムアウトエラーが増加しました。これは仕事の割り当てに影響します。応募の誤差率は1.3%で 採用の遅延は53秒でした捜査中です 客のサブセットの エージェントAPIの 遅延とエラー率が増加しています
5月30日 00:30 UTC 解決 - メールの配送が機能していないと報告され、登録と招待メール、およびビルド通知メールに影響を与えています。 この問題は現在解決されています。
5月28日 21:18 UTC 解決 - この事件は解決されました。5月28日 20:47 UTC 特定 - 何かおかしいことを発見しました現時点では調査中です。 速やかに更新します。5月28日 20:20 UTC調査 - 建設の遅延と顧客の一部の雇用通知を調査しています。
5月26日 10:38 UTC 解決しました - 問題の影響が終わったと思います。5月26日 10:37 UTC更新 - 影響を受けたすべてのサービスの処理時間が20分前に正常に戻ったことがわかります。5月26日 10:08 UTCモニタリング - 問題を特定し 修復手順を完了しました5月26日 09:56 UTC 確認 遅延が増加している
5月20日17時39分 (UTC) 解決 - 事件は解決しました 5月20日17時26分 (UTC) 監視 - 影響を受けた顧客全体で回復が見られ、引き続き監視されています 5月20日17時06分 (UTC) 特定 - 問題を特定し、緩和措置を適用し、回復を監視しています 通知の遅延によって影響を受けるのは顧客の一小部分のみであると判断しました5月20日 16時40分 UTC調査
5月15日 07:35 UTC 解決 - 滞納処理が完了しました。5月15日 06:51 UTC モニタリング - 内部キューからデータストアへのテストエンジン実行データの摂取は停止し、再開され、バックログを処理しています。過去1時間のテスト実行の可視性は、約1時間遅れます。 これは繰り返し発生する問題です。
5月13日 15:34 UTC 解決しました - 追加容量が redisキャッシュに追加されました。これは、UTC 15:10 - 15:14 の間にエラーオーバーを誘発し、REST と GraphQL API のエラーが急増した。この期間中に Buildkite UI にいくつかのエラーが表示されたでしょう。状況を監視し 状況が元に戻りました5月13日15時14分 UTC調査。..
5月12日 16:09 UTC 解決 - 修正は成功し、遅滞はクリアされました。5月12日 12:59 UTCモニタリング - 現在テストエンジンデータの処理が遅れている。我々は、問題に対する修正を特定し、適用しましたが、我々は、飲み込みバックログをクリアする間、遅延を経験し続けることを期待しています。
5月9日 04:34 UTC 解決 - us-east-1 の上流 AWS 事件は AWS によって解決され、すべての Buildkite サービスは正常に動作しています。顧客への影響は予想されませんこの事件の間、あなたの忍耐に感謝します。5月8日 08:07 UTCモニタリング - AWSの継続的な事件にもかかわらず、当社のサービスは現在安定しています。我々は我々のサービスを 監視し続けています。..
5月8日 23:42 UTC 解決 - 遅延したバックログがクリアされ、テストエンジンの摂取は正常に動作しています。5月8日 21:10 UTC調査 - 現在テストエンジンデータの処理が遅れている。問題の解決法を特定し 適用しましたが 飲み込みの遅れを 解決するまでの間に 延期が続くことを期待しています現在の処理速度では。..
5月8日 13:06 UTC 解決 - テストエンジンのバックログがクリアされ、正常に動作しています。5月8日 12:20 UTCモニタリング - 現在テストエンジンデータの処理が遅れている。この問題に対する修正を特定し 適用しましたが 処理の遅延が続くと予想しています現在の処理速度では バック。..