【フルリモート/週5】Pythonデータエンジニア(モダンデータスタック・ペタバイト級データパイプラインのアーキテクチャ設計)

掲載終了28日前

【フルリモート/週5】Pythonデータエンジニア(モダンデータスタック・ペタバイト級データパイプラインのアーキテクチャ設計)

4,700〜5,100/時

作業内容

【フルリモート/週5】Pythonデータエンジニア(モダンデータスタック・ペタバイト級データパイプラインのアーキテクチャ設計) ### お任せしたいこと 自社プロダクトや全社横断のデータ利活用を根底から支えるため、Pythonおよびモダンデータスタック(dbt, Airflow, Snowflake/BigQuery等)を活用した、ペタバイト級のデータパイプラインとデータプラットフォームの設計・開発をお任せします。 「とりあえずCronで回すだけのスパゲッティ化されたバッチ処理」や「誰も品質を保証できないデータスワンプ(沼)」を徹底的に排除し、冪等性(Idempotency)とデータリネージを担保した堅牢なデータアーキテクチャを泥臭く構築することで、データサイエンティストや経営層が安全かつ最速でビジネス価値を引き出せる基盤を牽引していただく中核的なポジションです。 ### 具体的な業務内容 ・Python 3.x および Apache Airflow(または Prefect, Dagster)を用いた、複雑な依存関係を持つELT/ETLデータパイプラインの設計・開発とワークフロー自動化 ・dbt(data build tool)を活用した、SQLによるデータモデリングのコード化(バージョン管理、テスト、ドキュメント生成の自動化) ・Snowflake または Google BigQuery 等のクラウドDWHにおける、ペタバイト規模のクエリパフォーマンス最適化およびコストチューニング ・Apache Kafka、Spark Streaming 等を用いた、リアルタイムに近い非同期ストリーミングデータ処理基盤の実装 ・Great Expectations 等のツールを利用した、パイプライン上でのデータ品質(アノマリー、欠損、型の不一致)の継続的な監視と自動アラート機構の構築 ・Terraformを用いたデータインフラのコード化(IaC)、およびGitHub Actionsを利用したDataOps(データパイプラインのCI/CD)環境の構築 ・様々な外部SaaSのAPI(Salesforce, Zendesk等)やレガシーなオンプレミスRDBMSからの、レートリミットやネットワーク境界を考慮した泥臭いデータ抽出ロジックの実装 ### 必須スキル・経験 ・Pythonを用いたバックエンド開発、またはデータパイプライン構築の実務経験(目安として3年以上) ・複雑なSQLを用いたデータ抽出・加工、および実行計画を考慮したパフォーマンスチューニングの実務経験 ・AWS、またはGCP等のパブリッククラウドを利用したインフラ構築・運用経験 ・Git / GitHubを用いたプルリクエストベースでのチーム開発経験 ### 歓迎スキル・経験 ・Apache Airflow等のワークフローエンジンを用いた大規模なバッチ処理基盤の構築・運用経験 ・dbtを用いたデータモデリング、およびデータウェアハウス(BigQuery, Snowflake, Redshift等)の実務運用経験 ・Apache Spark等の分散処理フレームワークを利用したビッグデータ処理経験 ・DataOpsの実践経験、またはデータガバナンス・メタデータ管理ツール(DataHub等)の導入経験 ・基礎的な機械学習(ML)の知識、またはMLOps環境構築の支援経験 ### 開発・業務環境 開発言語:Python 3.x, SQL ワークフロー:Apache Airflow (または Prefect, Dagster) データ変換・モデリング:dbt DWH・データベース:Google BigQuery (または Snowflake), Amazon Redshift 分散処理・ストリーミング:Apache Spark, Apache Kafka, AWS Kinesis インフラ・コンテナ:AWS または GCP, Docker, Kubernetes 品質・監視:Great Expectations, Datadog コミュニケーション・管理:GitHub, Jira, Slack, Zoom ### プロジェクトチームについて 「データこそが企業の最大の競争源泉である」と確信し、ソフトウェアエンジニアリングのベストプラクティスをデータ領域に持ち込むデータプラットフォームチームへの配属となります。 「データパイプラインが落ちたからアナリストが手動でリトライする」といった属人的な運用を極めて嫌い、障害が発生しても自動でリカバリ可能な冪等性のあるパイプライン構築を重視する手堅いカルチャーです。APIの突然の仕様変更や上流システムの謎のデータ欠損に直面した際にも、文句を言うのではなく、データ品質の監視をコード化して泥臭く検知・防御する実直なメンバーが集まっています。 ### 求める人物像 ・「データを右から左へ流すだけの作業者」ではなく、データのライフサイクル全体を俯瞰し、アーキテクチャの力でビジネスの意思決定を加速させることにエンジニアとしての美学を持てる方 ・上流のRDBMSの勝手なスキーマ変更や、フォーマットの不揃いな汚いデータ(Dirty Data)に対して、パズルを解くように泥臭いクレンジングと前処理を楽しめる方 ・データアナリストやMLエンジニアと密に連携し、「誰が、何のためにそのデータを使うのか」から逆算して、過不足のないテーブル設計を論理的に提案できる方 ### 仕事の魅力 世界的な潮流である「モダンデータスタック(Modern Data Stack)」の最前線を体感し、ペタバイト級のビッグデータを扱う大規模基盤を少人数で構築・運用する、極めて影響力と社会的意義の高いポジションです。単なる「SQLやバッチ処理を書く人」を完全に凌駕し、ソフトウェアエンジニアリングとデータアナリティクスの境界を繋ぐ「シニア・データエンジニア(データ基盤アーキテクト)」としての圧倒的な市場価値を築くことができます。 ### 働き方 #### リモート環境 **[フルリモート]** 基本的にフルリモートで働いていただけます。

稼働条件

週5日 / フルリモート

契約形態

業務委託(フリーランス)

開発環境

Python

募集回数

1回

スキル

バックエンド:
AIツール・LLMサービス:
ビジネスツール・コミュニケーション:
その他:

企業名

株式会社Kaizen Tech Agent

サービス/プロジェクト名

詳細スケジュール/リリース時期

現場責任者の雰囲気

開発体制の詳細

詳細は面談でお伝えします。ご相談ください。

一部の情報は非公開の場合があります

案件について詳しく聞いてみませんか?

知りたい内容を選んでください(複数選択可)