【Kubernetes/Linux/Docker/リモート併用】K8s Run:ai検証プロジェクト

募集中5日前

【Kubernetes/Linux/Docker/リモート併用】K8s Run:ai検証プロジェクト

700,000〜800,000/月

作業内容

【募集背景】 Kubernetes環境におけるノードおよびネットワーク分離、マルチクラスタ構成、GPU利用方式に関する動作検証を実施します。 【作業内容】 ユーザー単位で利用可能なノード・ネットワークを分離した場合の動作を検証します。2クラスタ構成でストレージを共有し、Run:aiを各クラスタで独立稼働させる構成を検証します。用途に応じたローカルGPU・分散GPUの使い分け手法を確立し、構成の妥当性を検証します。 【求める人物像】 顧客との要件ヒアリングや進捗報告を円滑に行い、検証結果を報告書として整理できる方を求めます。 【ポジションの魅力】 Kubernetes、マルチクラスタ、ネットワーク、ストレージ、GPU基盤を横断した検証に携われます。 【開発環境】 Kubernetes、Linux、Docker、Run:ai、GPU、共有ストレージを使用します。

必須スキル

・Kubernetesの基礎操作(kubectl操作、関連ドキュメント作成) ・Linuxサーバ運用の基礎知識 ・コンテナ/Dockerの基礎知識 ・検証設計・報告書作成及び顧客への報告経験 ・顧客折衝(要件ヒアロング・進捗報告)への抵抗がないこと ・高いコミュニケーション能力 ・Kubernetesクラスタ設計構築・運用経験(マルチクラスタ環境の経験があれば尚良) ・CNI(Calico/Cilium/Flannel等)の設計構築・運用経験、NetworkPolicy設計経験 ・VLAN設計、物理/仮想スイッチの設定経験 ・クラスタ間ネットワーク接続の設計経験(複数クラスタ間の疎通・ルーティング設計) ・分散/共有ストレージの設計構築・運用経験(NFS、Ceph、GlusterFS、またはVAST/Weka/PureStorage等AI向けストレージ製品) ・Kubernetes CSI(Container Storage Interface)の設計構築・運用経験 ・複数クラスタから同一ストレージへアクセスさせる構成の設計経験

歓迎スキル

・NVIDIA GPU Operator、GPUドライバ/CUDAの知識 ・Run:aiの実機構築・運用経験(Project/Department/Node Pool設定、フラクショナルGPU、Gang Scheduling) ・分散学習フレームワークの知識(PyTorch DDP、Horovod、DeepSpeed等)とKubernetes上での実行経験(Kubeflow Training Operator等)

稼働条件

週5日 / 常駐

契約形態

業務委託

開発環境

Kubernetes、Linux、Docker、Run:ai、GPU、共有ストレージを使用します。

募集回数

1回

スキル

バックエンド:

企業名

サービス/プロジェクト名

詳細スケジュール/リリース時期

現場責任者の雰囲気

開発体制の詳細

詳細は面談でお伝えします。ご相談ください。

一部の情報は非公開の場合があります

案件について詳しく聞いてみませんか?

知りたい内容を選んでください(複数選択可)

スキルで絞り込む