【Kubernetes/GPU/Linux/リモート可】大規模LLM環境を含むシステム運用・保守支援
作業内容
大規模LLM/AI推論環境を含むGPUサーバー群の運用・保守支援をお任せします。 - サーバー予約管理のWeb化(Excel管理からWebシステムへの移行) - サーバー占有時間の自動通知メール実装/運用 - アカウント管理(パスワード払い出し)、サーバー占有状況の管理 - 利用者向け情報共有(運用ドキュメントや共有ファイルの展開・メンテナンス・障害情報の周知) - FAQ整備、問い合わせ一次受付/切り分け(障害問合せのハブ対応) Kubernetesを用いた環境、NVIDIA GPUを搭載したLinuxサーバー群を対象とし、安定運用のための改善や自動化にも関与いただきます。 募集背景 LLM/AI推論需要の拡大に伴い、GPUサーバーおよびKubernetes基盤の安定運用と業務効率化(予約管理のWeb化、自動通知など)の推進が必要となったため、体制強化を図ります。
必須スキル
以下いずれかを満たすこと: - Kubernetesの基本操作経験(デプロイ/Pod/Service等の取り扱い)または LLM・AI推論環境の運用経験 - GPUサーバーの利用経験(ジョブ実行やリソース管理の実務) - Linuxサーバーの運用/利用経験(基本的な管理・トラブルシュート)
歓迎スキル
以下のご経験がある方を歓迎します: - Kubernetes本番運用・保守の実務経験 - NVIDIA GPU/CUDAスタックに関する知識 - LLM/AI推論環境(推論サーバー/モデル配備)の運用経験 - 運用自動化(スクリプト化、通知/監視連携)の実務
稼働条件
平日フルタイム想定。リモート主体で、状況により週1回の出社可能性あり。 / おおむね140〜180時間/月を想定 / 一部リモート可
契約形態
業務委託(フリーランス)
開発環境
技術スタック/環境: - インフラ:Kubernetes、Linux(各種ディストリビューション) - ハードウェア:NVIDIA GPU搭載サーバー、CUDA関連ツール - 運用:監視/通知連携、アカウント/権限管理、FAQ/ドキュメント整備 - その他:Web化による予約管理機能の実装・運用(簡易なバックエンド/ジョブ連携が想定)
作業時間
9:30〜18:30(目安)※リモート主体、週1回程度の出社可能性あり
精算基準時間
140h〜180h
募集回数
1回
スキル
企業名
サービス/プロジェクト名
詳細スケジュール/リリース時期
現場責任者の雰囲気
開発体制の詳細
詳細は面談でお伝えします。ご相談ください。
一部の情報は非公開の場合があります
案件について詳しく聞いてみませんか?
知りたい内容を選んでください(複数選択可)