【Kubernetes/GPU/Linux/リモート可】大規模LLM環境を含むシステム運用・保守支援

掲載終了3ヶ月前

【Kubernetes/GPU/Linux/リモート可】大規模LLM環境を含むシステム運用・保守支援

550,000〜580,000/月

作業内容

大規模LLM/AI推論環境を含むGPUサーバー群の運用・保守支援をお任せします。 - サーバー予約管理のWeb化(Excel管理からWebシステムへの移行) - サーバー占有時間の自動通知メール実装/運用 - アカウント管理(パスワード払い出し)、サーバー占有状況の管理 - 利用者向け情報共有(運用ドキュメントや共有ファイルの展開・メンテナンス・障害情報の周知) - FAQ整備、問い合わせ一次受付/切り分け(障害問合せのハブ対応) Kubernetesを用いた環境、NVIDIA GPUを搭載したLinuxサーバー群を対象とし、安定運用のための改善や自動化にも関与いただきます。 募集背景 LLM/AI推論需要の拡大に伴い、GPUサーバーおよびKubernetes基盤の安定運用と業務効率化(予約管理のWeb化、自動通知など)の推進が必要となったため、体制強化を図ります。

必須スキル

以下いずれかを満たすこと: - Kubernetesの基本操作経験(デプロイ/Pod/Service等の取り扱い)または LLM・AI推論環境の運用経験 - GPUサーバーの利用経験(ジョブ実行やリソース管理の実務) - Linuxサーバーの運用/利用経験(基本的な管理・トラブルシュート)

歓迎スキル

以下のご経験がある方を歓迎します: - Kubernetes本番運用・保守の実務経験 - NVIDIA GPU/CUDAスタックに関する知識 - LLM/AI推論環境(推論サーバー/モデル配備)の運用経験 - 運用自動化(スクリプト化、通知/監視連携)の実務

稼働条件

平日フルタイム想定。リモート主体で、状況により週1回の出社可能性あり。 / おおむね140〜180時間/月を想定 / 一部リモート可

契約形態

業務委託(フリーランス)

開発環境

技術スタック/環境: - インフラ:Kubernetes、Linux(各種ディストリビューション) - ハードウェア:NVIDIA GPU搭載サーバー、CUDA関連ツール - 運用:監視/通知連携、アカウント/権限管理、FAQ/ドキュメント整備 - その他:Web化による予約管理機能の実装・運用(簡易なバックエンド/ジョブ連携が想定)

作業時間

9:30〜18:30(目安)※リモート主体、週1回程度の出社可能性あり

精算基準時間

140h〜180h

募集回数

1回

スキル

インフラ:
AIツール・LLMサービス:

企業名

サービス/プロジェクト名

詳細スケジュール/リリース時期

現場責任者の雰囲気

開発体制の詳細

詳細は面談でお伝えします。ご相談ください。

一部の情報は非公開の場合があります

案件について詳しく聞いてみませんか?

知りたい内容を選んでください(複数選択可)

スキルで絞り込む