大手SIer_GPUクラスター基盤構築支援(NVIDIA AI Enterprise/NVAIE)
作業内容
GPUaaS/AIファクトリー案件の増加に伴い、GPUクラスターのサーバー・ソフトウェアスタック領域の技術者として、プロパーと共に構築・導入をリードする。主な業務内容は以下の通り。 ・GPUサーバー(NVIDIA DGX/HGX、各社OEMサーバー)を用いたGPUクラスターの要件定義・基本設計・詳細設計 ・GPUサーバーのキッティング、OS(Ubuntu/RHEL)・GPUドライバ・CUDA・ファームウェアの導入および構築自動化 ・NVIDIA AI Enterprise(NIM、NeMo、Triton Inference Server等)の導入・ライセンス設計・動作検証 ・ジョブスケジューラ(Slurm)/Kubernetes(NVIDIA GPU Operator等)によるGPUリソース管理・マルチテナント環境の構築 ・NVIDIA Base Command Manager等によるクラスター管理基盤の構築、監視(DCGM等)・運用設計 ・NCCLテスト・ベンチマーク等による性能評価、障害切り分け・チューニング ・顧客向け提案・技術支援(構成検討、見積根拠作成、技術QA対応)
必須スキル
・NVIDIA AI Enterprise(NIM、NeMo、Triton Inference Server、GPU Operator等)の導入・運用経験 ・GPUクラスターまたはHPCクラスターの設計・構築の実務経験(サーバー領域) ・Linux(Ubuntu/RHEL等)サーバーの設計・構築・運用の実務経験 ・NVIDIA GPUドライバ、CUDA、コンテナランタイム(NVIDIA Container Toolkit等)の導入・トラブルシュート経験 ・Slurm、Kubernetes等を用いたGPUリソース管理基盤の構築経験 ・インフラ構築プロジェクトにおけるリーダーまたはサブリーダーとしての推進経験
歓迎スキル
・NVIDIA DGX SuperPOD/DGX BasePOD、HGX系サーバーの構築経験 ・NVIDIA Base Command Manager(旧Bright Cluster Manager)の利用経験 ・大規模分散学習(PyTorch分散、NCCL、MPI)の性能検証・チューニング経験 ・NVIDIA認定資格(NVIDIA-Certified Professional: AI Infrastructure等) ・GPUaaS/プライベートクラウドの商用サービス立ち上げ経験
稼働条件
一部リモート
面談回数
2回
契約形態
業務委託(フリーランス)
募集回数
1回
企業名
サービス/プロジェクト名
詳細スケジュール/リリース時期
現場責任者の雰囲気
開発体制の詳細
詳細は面談でお伝えします。ご相談ください。
一部の情報は非公開の場合があります
案件について詳しく聞いてみませんか?
知りたい内容を選んでください(複数選択可)
