【AIエンジニア】NVIDIA GB200を用いた超長尺エピゲノム言語モデルの分散事前学習開発の求人・案件
この案件を3行でまとめると
- AI×医療・バイオ領域で1兆データポイントのエピゲノム言語モデルを設計し、最先端の生成AI基盤を開発します。
- GB200複数ノードを用いた分散事前学習環境を構築し、Mamba等の超長尺コンテキスト対応モデルを実装・最適化します。
- 週4〜5日常駐で東京都勤務、月250万円の単価で高度なR&Dに挑戦できるポジションです。
作業内容
AI×医療・バイオ領域における最先端の生成AI基盤モデル開発。 ・1兆データポイントのエピゲノムデータを用いた言語モデルの設計およびフルスクラッチ事前学習 ・GB200(複数ノード)を用いた大規模分散事前学習環境の構築・最適化 ・数千万規模の超長尺コンテキストに対応するモデル構造(Mambaやコンテキスト並列等)の検討・実装 ※分散学習時のメモリ・通信ボトルネックを自力で解決する挑戦的なR&Dポジションです。
必須スキル
– マルチノードGPU環境における大規模モデルの分散事前学習経験(または同等の知見) – PyTorch、DeepSpeed、Megatron-LM等を用いた並列学習(テンソル/パイプライン/コンテキスト並列)の実装・最適化経験 – OOMや通信ボトルネック発生時、CUDAや通信レイヤーを含めて原因特定・解決できる高度なトラブルシューティング能力 – 超長尺コンテキストを扱う代替バックボーン(Mamba、状態空間モデル等)への強い関心とキャッチアップ力
歓迎スキル
– 数B〜数十B規模以上のモデルのフルスクラッチ事前学習・継続事前学習経験 – Ring AttentionやSequence Parallelism等の超長尺処理技術の知見 – AWS(SageMaker HyperPod等)/GCP/Azureでの大規模GPUクラスタ構築・運用経験 – NVIDIA Blackwell(GB200/B200)環境での開発経験 – バイオインフォマティクスやオミクスデータの解析知見、トップカンファレンス論文の実装・再現経験
稼働条件
週4日 / 週5日 / 常駐
面談回数
1回
契約形態
準委任(個人事業主)
開発環境
環境・ツール: AWS / Azure / GCP フレームワーク・ライブラリ: PyTorch
募集回数
1回
企業名
サービス/プロジェクト名
詳細スケジュール/リリース時期
現場責任者の雰囲気
開発体制の詳細
詳細は面談でお伝えします。ご相談ください。
一部の情報は非公開の場合があります
この案件のおすすめポイント
- 東京都内で常駐勤務、週4〜5日でフルタイムの働き方が可能です。
- AIエンジニアでマルチノードGPU環境の分散学習経験がある方に最適な案件です。
- 1兆データポイントを扱う超長尺エピゲノム言語モデルの設計・実装に挑戦し、最先端の生成AI技術を磨けます。
よくある質問
案件について詳しく聞いてみませんか?
知りたい内容を選んでください(複数選択可)
