大手SIer_GPUクラスター基盤構築支援(NVIDIA AI Enterprise/NVAIE)

掲載終了8日前

大手SIer_GPUクラスター基盤構築支援(NVIDIA AI Enterprise/NVAIE)

1,300,000〜1,600,000/月

作業内容

GPUaaS/AIファクトリー案件の増加に伴い、GPUクラスターのサーバー・ソフトウェアスタック領域の技術者として、プロパーと共に構築・導入をリードする。主な業務内容は以下の通り。 ・GPUサーバー(NVIDIA DGX/HGX、各社OEMサーバー)を用いたGPUクラスターの要件定義・基本設計・詳細設計 ・GPUサーバーのキッティング、OS(Ubuntu/RHEL)・GPUドライバ・CUDA・ファームウェアの導入および構築自動化 ・NVIDIA AI Enterprise(NIM、NeMo、Triton Inference Server等)の導入・ライセンス設計・動作検証 ・ジョブスケジューラ(Slurm)/Kubernetes(NVIDIA GPU Operator等)によるGPUリソース管理・マルチテナント環境の構築 ・NVIDIA Base Command Manager等によるクラスター管理基盤の構築、監視(DCGM等)・運用設計 ・NCCLテスト・ベンチマーク等による性能評価、障害切り分け・チューニング ・顧客向け提案・技術支援(構成検討、見積根拠作成、技術QA対応)

必須スキル

・NVIDIA AI Enterprise(NIM、NeMo、Triton Inference Server、GPU Operator等)の導入・運用経験 ・GPUクラスターまたはHPCクラスターの設計・構築の実務経験(サーバー領域) ・Linux(Ubuntu/RHEL等)サーバーの設計・構築・運用の実務経験 ・NVIDIA GPUドライバ、CUDA、コンテナランタイム(NVIDIA Container Toolkit等)の導入・トラブルシュート経験 ・Slurm、Kubernetes等を用いたGPUリソース管理基盤の構築経験 ・インフラ構築プロジェクトにおけるリーダーまたはサブリーダーとしての推進経験

歓迎スキル

・NVIDIA DGX SuperPOD/DGX BasePOD、HGX系サーバーの構築経験 ・NVIDIA Base Command Manager(旧Bright Cluster Manager)の利用経験 ・大規模分散学習(PyTorch分散、NCCL、MPI)の性能検証・チューニング経験 ・NVIDIA認定資格(NVIDIA-Certified Professional: AI Infrastructure等) ・GPUaaS/プライベートクラウドの商用サービス立ち上げ経験

稼働条件

一部リモート

面談回数

2回

契約形態

業務委託(フリーランス)

募集回数

1回

スキル

バックエンド:

企業名

サービス/プロジェクト名

詳細スケジュール/リリース時期

現場責任者の雰囲気

開発体制の詳細

詳細は面談でお伝えします。ご相談ください。

一部の情報は非公開の場合があります

案件について詳しく聞いてみませんか?

知りたい内容を選んでください(複数選択可)