【Kubernetes/Linux/Docker/リモート併用】K8s Run:ai検証プロジェクト
作業内容
【募集背景】 Kubernetes環境におけるノードおよびネットワーク分離、マルチクラスタ構成、GPU利用方式に関する動作検証を実施します。 【作業内容】 ユーザー単位で利用可能なノード・ネットワークを分離した場合の動作を検証します。2クラスタ構成でストレージを共有し、Run:aiを各クラスタで独立稼働させる構成を検証します。用途に応じたローカルGPU・分散GPUの使い分け手法を確立し、構成の妥当性を検証します。 【求める人物像】 顧客との要件ヒアリングや進捗報告を円滑に行い、検証結果を報告書として整理できる方を求めます。 【ポジションの魅力】 Kubernetes、マルチクラスタ、ネットワーク、ストレージ、GPU基盤を横断した検証に携われます。 【開発環境】 Kubernetes、Linux、Docker、Run:ai、GPU、共有ストレージを使用します。
必須スキル
・Kubernetesの基礎操作(kubectl操作、関連ドキュメント作成) ・Linuxサーバ運用の基礎知識 ・コンテナ/Dockerの基礎知識 ・検証設計・報告書作成及び顧客への報告経験 ・顧客折衝(要件ヒアロング・進捗報告)への抵抗がないこと ・高いコミュニケーション能力 ・Kubernetesクラスタ設計構築・運用経験(マルチクラスタ環境の経験があれば尚良) ・CNI(Calico/Cilium/Flannel等)の設計構築・運用経験、NetworkPolicy設計経験 ・VLAN設計、物理/仮想スイッチの設定経験 ・クラスタ間ネットワーク接続の設計経験(複数クラスタ間の疎通・ルーティング設計) ・分散/共有ストレージの設計構築・運用経験(NFS、Ceph、GlusterFS、またはVAST/Weka/PureStorage等AI向けストレージ製品) ・Kubernetes CSI(Container Storage Interface)の設計構築・運用経験 ・複数クラスタから同一ストレージへアクセスさせる構成の設計経験
歓迎スキル
・NVIDIA GPU Operator、GPUドライバ/CUDAの知識 ・Run:aiの実機構築・運用経験(Project/Department/Node Pool設定、フラクショナルGPU、Gang Scheduling) ・分散学習フレームワークの知識(PyTorch DDP、Horovod、DeepSpeed等)とKubernetes上での実行経験(Kubeflow Training Operator等)
稼働条件
週5日 / 常駐
契約形態
業務委託
開発環境
Kubernetes、Linux、Docker、Run:ai、GPU、共有ストレージを使用します。
募集回数
1回
スキル
企業名
サービス/プロジェクト名
詳細スケジュール/リリース時期
現場責任者の雰囲気
開発体制の詳細
詳細は面談でお伝えします。ご相談ください。
一部の情報は非公開の場合があります
案件について詳しく聞いてみませんか?
知りたい内容を選んでください(複数選択可)
