TechGo

ITエンジニア転職ならテックゴー

ITエンジニア転職・求人TOP>

QAエンジニア・テストエンジニア(テスター)(PyTorch)の求人・転職情報

該当求人数 2

1~2件を表示

JAPAN AI株式会社

JAPAN AI株式会社

【JAPAN AI】AI Evaluation Scientist / Japanese

QAエンジニア・テストエンジニア(テスター)

800~1,600万円

正社員

東京都(新宿区)

ミッション "AI の出力品質を科学する — 評価手法の研究・開発で、エージェントの信頼性を証明する" LLM / AIエージェントの出力品質を、機械学習・統計学・計量心理学の手法で定量的に評価・改善します。本ポジションは「テストする人」ではなく、 「何をもって良いAIとするかを定義し、測定する科学者」 です。 期待する役割について AI Evaluation Scientist として、AI エージェントの品質評価基盤の設計・構築・運用をリードしていただきます。 ●評価メトリクスの研究開発 — LLM-as-Judge の校正、報酬モデリング、ベンチマーク設計を通じて「何をもって品質とするか」を科学的に定義します ●自動評価パイプラインの設計・構築 — 研究成果を本番 CI/CD に組み込み、スケーラブルな品質ゲートを実現します ●レッドチーミング・安全性検証 — adversarial testing の自動化、ポリシー準拠検証フレームワークを構築します ●統計的実験計画に基づく品質改善 — A/B テスト・有意差検定でプロンプト戦略やモデル変更の効果を定量的に検証します ●評価シグナルの研究・開発チームへのフィードバック — モデル改善の複利ループを構築します 約 200 社が本番利用するプロダクトの品質を「科学する」アプローチで担保します 業務内容 AI Evaluation Scientistとして、 AIエージェントの評価基盤 (Evaluation Infrastructure) の設計・構築・運用をリードしていただきます。 ●評価メトリクスの研究開発 ・LLM-as-Judge の校正手法の研究・実装 (rubric 設計、バイアス検出、proper scoring rules) ・評価ベンチマークの設計・構築・妥当性検証 (construct validity、contamination detection) ・報酬モデリング / preference learning の評価への応用研究 ・評価メトリクスの選定・設計 (win rate、task success、factuality、harm detection) ・評価セット (合成データ + 実ログ) の設計・構築・メンテナンス ●自動評価パイプラインの設計・構築 ・スケーラブルな自動評価パイプラインの設計・実装 ・CI/CD への評価パイプライン組込みと品質ゲートの構築 ・エージェント評価ハーネスの設計 (マルチターン・ツール利用・ロングコンテキスト対応) ・評価パイプラインの再現性・信頼性の担保 ●安全性・品質検証 ・自動レッドチーミング (automated adversarial testing) の研究・実装 ・安全性 / ポリシー準拠の検証フレームワーク構築 ・ハルシネーション検出・校正手法の研究・実装 ・プロンプト / ツール回帰テストの設計・実行 ●統計分析・実験設計 ・統計的実験計画 (A/B テスト、有意差検定) の設計・分析 ・品質トレンドの可視化・回帰検出の自動化 ・品質レポート作成と改善提案 ・評価シグナルの研究・開発チームへのフィードバック 業務シナリオ ※以下は想定される業務シナリオの例です ●シナリオ1: LLM-as-Judge の校正と妥当性検証 新しい評価メトリクスとして LLM-as-Judge を導入する際、judge モデルの校正 (calibration) を実施します。人間評価との一致率を統計的に検証し、rubric 設計を反復改善します。construct validity を確認した上で、自動評価パイプラインに組み込み、評価コストを 80% 削減しながら人間評価と同等の信頼性を実現します。 ●シナリオ2: 新モデル導入時の品質ゲート LLMプロバイダーが新モデルをリリースした際、既存のベンチマークスイートで回帰テストを実行し、factualityスコアが3%低下していることを検出します。原因を分析し、プロンプト調整で品質を維持したまま新モデルへの移行を完了します。 ●シナリオ3: 自動レッドチーミングによる安全性検証 金融機関向けにJAPAN AI AGENTを導入する際、自動レッドチーミングパイプラインを構築します。adversarial promptの自動生成・分類器による脆弱性検出を実装し、業界固有のリスクシナリオ(機密情報漏洩、不適切な金融アドバイス等)を網羅的にテストします。ポリシー準拠率99%以上を達成します。 ●従事すべき業務の変更の範囲 会社の定める業務 成果責任 (KR/メトリクス) ●評価カバレッジ率(テストケース網羅率) ●回帰検出率(リリース前の品質劣化検出率 ≥ 95%) ●評価パイプライン実行時間(CI/CD内で完了) ●LLM-as-Judge と人間評価の一致率 ●False Positive / Negative 率 ●安全性インシデント発生率(リリース後) チーム体制 約120名が開発組織に在籍しています。 AI Evaluation Scientistは品質保証の専門チームとして、以下のチームと密接に連携します: ●密接に連携する役割: ・Agentic Product Engineer — エージェント機能開発 ・Research Engineer — 研究開発・モデル改善 ・Agent Harness Engineer / Software Engineer (AI Platform) — AI 実行基盤開発 ・Product Manager — プロダクト設計・品質要件定義 開発環境 ●言語 : Python (評価パイプライン・分析), TypeScript / React / Next.js (フロントエンド部) / NX ●評価 / QA : pytest, LangSmith, Weights & Biases, custom eval frameworks ●データ : BigQuery, Spark, Pandas ●インフラ : GCP (コンテナ / K8s), Docker, Terraform ●CI/CD : GitHub Actions ●ツール : Slack, Confluence, Linear, Google Workspace, GitHub, Notion ●AI 開発支援 : Claude Code MAX Plan, Cursor, ChatGPT, Devin ●作業環境 : Mac (Apple Silicon), デュアルモニタ対応

Spark

Docker

Confluence

React

Snowflake

Kubernetes

FastAPI

GitHub Actions

GitHub

Google Cloud Platform(GCP)

BigQuery

Next.js

PyTorch

TensorFlow

Notion

TypeScript

Slack

Terraform

社宅・家賃補助制度あり

資格取得支援制度あり

持ち株会制度あり

ストックオプション(信託型等)あり

生成AI開発ツール導入

英語活用

リモート可

土日祝日休み

機械学習・データ活用

【JAPAN AI】AI Evaluation Scientist / Japanese

QAエンジニア・テストエンジニア(テスター)

正社員

ミッション "AI の出力品質を科学する — 評価手法の研究・開発で、エージェントの信頼性を証明する" LLM / AIエージェントの出力品質を、機械学習・統計学・計量心理学の手法で定量的に評価・改善します。本ポジションは「テストする人」ではなく、 「何をもって良いAIとするかを定義し、測定する科学者」 です。 期待する役割について AI Evaluation Scientist として、AI エージェントの品質評価基盤の設計・構築・運用をリードしていただきます。 ●評価メトリクスの研究開発 — LLM-as-Judge の校正、報酬モデリング、ベンチマーク設計を通じて「何をもって品質とするか」を科学的に定義します ●自動評価パイプラインの設計・構築 — 研究成果を本番 CI/CD に組み込み、スケーラブルな品質ゲートを実現します ●レッドチーミング・安全性検証 — adversarial testing の自動化、ポリシー準拠検証フレームワークを構築します ●統計的実験計画に基づく品質改善 — A/B テスト・有意差検定でプロンプト戦略やモデル変更の効果を定量的に検証します ●評価シグナルの研究・開発チームへのフィードバック — モデル改善の複利ループを構築します 約 200 社が本番利用するプロダクトの品質を「科学する」アプローチで担保します 業務内容 AI Evaluation Scientistとして、 AIエージェントの評価基盤 (Evaluation Infrastructure) の設計・構築・運用をリードしていただきます。 ●評価メトリクスの研究開発 ・LLM-as-Judge の校正手法の研究・実装 (rubric 設計、バイアス検出、proper scoring rules) ・評価ベンチマークの設計・構築・妥当性検証 (construct validity、contamination detection) ・報酬モデリング / preference learning の評価への応用研究 ・評価メトリクスの選定・設計 (win rate、task success、factuality、harm detection) ・評価セット (合成データ + 実ログ) の設計・構築・メンテナンス ●自動評価パイプラインの設計・構築 ・スケーラブルな自動評価パイプラインの設計・実装 ・CI/CD への評価パイプライン組込みと品質ゲートの構築 ・エージェント評価ハーネスの設計 (マルチターン・ツール利用・ロングコンテキスト対応) ・評価パイプラインの再現性・信頼性の担保 ●安全性・品質検証 ・自動レッドチーミング (automated adversarial testing) の研究・実装 ・安全性 / ポリシー準拠の検証フレームワーク構築 ・ハルシネーション検出・校正手法の研究・実装 ・プロンプト / ツール回帰テストの設計・実行 ●統計分析・実験設計 ・統計的実験計画 (A/B テスト、有意差検定) の設計・分析 ・品質トレンドの可視化・回帰検出の自動化 ・品質レポート作成と改善提案 ・評価シグナルの研究・開発チームへのフィードバック 業務シナリオ ※以下は想定される業務シナリオの例です ●シナリオ1: LLM-as-Judge の校正と妥当性検証 新しい評価メトリクスとして LLM-as-Judge を導入する際、judge モデルの校正 (calibration) を実施します。人間評価との一致率を統計的に検証し、rubric 設計を反復改善します。construct validity を確認した上で、自動評価パイプラインに組み込み、評価コストを 80% 削減しながら人間評価と同等の信頼性を実現します。 ●シナリオ2: 新モデル導入時の品質ゲート LLMプロバイダーが新モデルをリリースした際、既存のベンチマークスイートで回帰テストを実行し、factualityスコアが3%低下していることを検出します。原因を分析し、プロンプト調整で品質を維持したまま新モデルへの移行を完了します。 ●シナリオ3: 自動レッドチーミングによる安全性検証 金融機関向けにJAPAN AI AGENTを導入する際、自動レッドチーミングパイプラインを構築します。adversarial promptの自動生成・分類器による脆弱性検出を実装し、業界固有のリスクシナリオ(機密情報漏洩、不適切な金融アドバイス等)を網羅的にテストします。ポリシー準拠率99%以上を達成します。 ●従事すべき業務の変更の範囲 会社の定める業務 成果責任 (KR/メトリクス) ●評価カバレッジ率(テストケース網羅率) ●回帰検出率(リリース前の品質劣化検出率 ≥ 95%) ●評価パイプライン実行時間(CI/CD内で完了) ●LLM-as-Judge と人間評価の一致率 ●False Positive / Negative 率 ●安全性インシデント発生率(リリース後) チーム体制 約120名が開発組織に在籍しています。 AI Evaluation Scientistは品質保証の専門チームとして、以下のチームと密接に連携します: ●密接に連携する役割: ・Agentic Product Engineer — エージェント機能開発 ・Research Engineer — 研究開発・モデル改善 ・Agent Harness Engineer / Software Engineer (AI Platform) — AI 実行基盤開発 ・Product Manager — プロダクト設計・品質要件定義 開発環境 ●言語 : Python (評価パイプライン・分析), TypeScript / React / Next.js (フロントエンド部) / NX ●評価 / QA : pytest, LangSmith, Weights & Biases, custom eval frameworks ●データ : BigQuery, Spark, Pandas ●インフラ : GCP (コンテナ / K8s), Docker, Terraform ●CI/CD : GitHub Actions ●ツール : Slack, Confluence, Linear, Google Workspace, GitHub, Notion ●AI 開発支援 : Claude Code MAX Plan, Cursor, ChatGPT, Devin ●作業環境 : Mac (Apple Silicon), デュアルモニタ対応

800~1,600万円

東京都(新宿区)

Spark

Docker

Confluence

React

Snowflake

Kubernetes

FastAPI

GitHub Actions

GitHub

Google Cloud Platform(GCP)

BigQuery

Next.js

PyTorch

TensorFlow

Notion

TypeScript

Slack

Terraform

社宅・家賃補助制度あり

資格取得支援制度あり

持ち株会制度あり

ストックオプション(信託型等)あり

生成AI開発ツール導入

英語活用

リモート可

土日祝日休み

機械学習・データ活用

JAPAN AI株式会社

JAPAN AI株式会社

株式会社カカクコム

株式会社カカクコム

SETエンジニア (AI×QA)【食べログ】

QAエンジニア・テストエンジニア(テスター)

800~1,200万円

正社員

東京都(渋谷区)

QA業務をAIエージェントが自律実行できるハーネスを設計・実装します。 【具体的な業務内容】 ・ハーネスエンジニアリングの実践 └ハーネスエンジニアリングの枠組みの中で、QA業務を担う各工程のAIエージェントを設計、構築します。 ・リスク分析/テスト分析/テスト設計エージェント └仕様書を分析し、その後の実装や自動テストコーディングへの入力を生成するQAの上流工程を担当するAIエージェントを設計、実装します。 ・自動テストコーディング、自動テスト実行エージェント └テスト設計結果を自動テストとして実装し実行するQA業務の中核となるAIエージェントを設計実装します。 ・CQフィードバックパイプラインの設計・実装 ・不具合/障害情報の集積、分析基盤の構築 └エラーログ/AIエージェント実行ログ/不具合レポート/障害レポートなどを集積し、後続の分析や再発防止策の策定を実施するための基盤を整備します。 ・障害分析や再発防止策実施エージェントの設計、実装 └AIや人間のミスの結果である障害情報を分析し、それらをAIエージェントから利用可能なコンテキストやSKILLの形に実装するAIエージェントの設計、実装をします。 ・外部AI動向の追跡と発信 ・Harness Engineering等のAI分野の最新動向を追跡し、業務設計に落とし込む ・社内の実践と学びを技術ブログ・カンファレンス等で外部発信する 【開発環境】 ●AIエージェント:Claude Code(SKILL / Sub-agent / Hooks / Agent Teams)/ Devin / MCP Server ●テスト自動化:Selenium, Appium, Cucumber, Playwright ●CI/CD:CircleCI, Bitrise ●データ基盤:BigQuery, Tableau ●タスク管理・分析:Asana ●コミュニケーション:Slack, Teams, GitHub, Confluence, Miro ●開発技術スタック:Ruby on Rails, React.js, Next.js, Swift/SwiftUI, Kotlin 【所属部門】 食べログカンパニー 開発本部 品質管理部 【ミッション】 品質管理部は「QA業務をAIが一貫して担う」ことを目指す長期ビジョン Continuous Quality by AI(CQ by AI) を推進するチームです。 そのAIが正しく品質を判断できるよう、QAの知識と基準をAIに渡すエキスパートとして参画していただきます。 単にテストを効率化するのではなく、「リリース前のチェックポイント」だったQAを、開発プロセスそのものに埋め込まれた自律的な仕組みへと変える取り組みです。 月間数千万人が使う食べログで、AIエージェントがコードレビュー・リスク分析・E2Eテストを担い、最終承認のみ人間が行う品質保証の実現を目指しています。 すでに自動テストコーディングでコード生成精度97%・テスト実行工数52%削減・自動化率64%の実績を上げており、その先のフェーズを共に作る段階にあります。 このポジションは AIが正しく品質判断できるようにQAドメインのナレッジをハーネスエンジニアリングの枠組みの中でガードレールやチェックリスト、基準などとして整備する役割 です。 従来のQAエンジニアが「自分でテストを設計・実行し、品質を判断する」のに対し、このポジションは「AIが判断するための基準を設計・検証し、AIの判断結果をレビューする」へと役割が変わります。 QAエンジニアとしての専門知識を活かしながら、業界でもまだ先例の少ない「AIに品質を教える仕事」を担っていただきます。

Confluence

React

Rails

FastAPI

GitHub

Google Cloud Platform(GCP)

BigQuery

PHP

Nginx

Next.js

PyTorch

TensorFlow

AWS

Swift

jQuery

Slack

CircleCI

Kotlin

育児支援制度あり

研修・勉強会あり

401k(確定拠出年金)あり

生成AI開発ツール導入

リモート可

フレックス勤務

時短勤務可

土日祝日休み

大規模トラフィック環境

SETエンジニア (AI×QA)【食べログ】

QAエンジニア・テストエンジニア(テスター)

正社員

QA業務をAIエージェントが自律実行できるハーネスを設計・実装します。 【具体的な業務内容】 ・ハーネスエンジニアリングの実践 └ハーネスエンジニアリングの枠組みの中で、QA業務を担う各工程のAIエージェントを設計、構築します。 ・リスク分析/テスト分析/テスト設計エージェント └仕様書を分析し、その後の実装や自動テストコーディングへの入力を生成するQAの上流工程を担当するAIエージェントを設計、実装します。 ・自動テストコーディング、自動テスト実行エージェント └テスト設計結果を自動テストとして実装し実行するQA業務の中核となるAIエージェントを設計実装します。 ・CQフィードバックパイプラインの設計・実装 ・不具合/障害情報の集積、分析基盤の構築 └エラーログ/AIエージェント実行ログ/不具合レポート/障害レポートなどを集積し、後続の分析や再発防止策の策定を実施するための基盤を整備します。 ・障害分析や再発防止策実施エージェントの設計、実装 └AIや人間のミスの結果である障害情報を分析し、それらをAIエージェントから利用可能なコンテキストやSKILLの形に実装するAIエージェントの設計、実装をします。 ・外部AI動向の追跡と発信 ・Harness Engineering等のAI分野の最新動向を追跡し、業務設計に落とし込む ・社内の実践と学びを技術ブログ・カンファレンス等で外部発信する 【開発環境】 ●AIエージェント:Claude Code(SKILL / Sub-agent / Hooks / Agent Teams)/ Devin / MCP Server ●テスト自動化:Selenium, Appium, Cucumber, Playwright ●CI/CD:CircleCI, Bitrise ●データ基盤:BigQuery, Tableau ●タスク管理・分析:Asana ●コミュニケーション:Slack, Teams, GitHub, Confluence, Miro ●開発技術スタック:Ruby on Rails, React.js, Next.js, Swift/SwiftUI, Kotlin 【所属部門】 食べログカンパニー 開発本部 品質管理部 【ミッション】 品質管理部は「QA業務をAIが一貫して担う」ことを目指す長期ビジョン Continuous Quality by AI(CQ by AI) を推進するチームです。 そのAIが正しく品質を判断できるよう、QAの知識と基準をAIに渡すエキスパートとして参画していただきます。 単にテストを効率化するのではなく、「リリース前のチェックポイント」だったQAを、開発プロセスそのものに埋め込まれた自律的な仕組みへと変える取り組みです。 月間数千万人が使う食べログで、AIエージェントがコードレビュー・リスク分析・E2Eテストを担い、最終承認のみ人間が行う品質保証の実現を目指しています。 すでに自動テストコーディングでコード生成精度97%・テスト実行工数52%削減・自動化率64%の実績を上げており、その先のフェーズを共に作る段階にあります。 このポジションは AIが正しく品質判断できるようにQAドメインのナレッジをハーネスエンジニアリングの枠組みの中でガードレールやチェックリスト、基準などとして整備する役割 です。 従来のQAエンジニアが「自分でテストを設計・実行し、品質を判断する」のに対し、このポジションは「AIが判断するための基準を設計・検証し、AIの判断結果をレビューする」へと役割が変わります。 QAエンジニアとしての専門知識を活かしながら、業界でもまだ先例の少ない「AIに品質を教える仕事」を担っていただきます。

800~1,200万円

東京都(渋谷区)

Confluence

React

Rails

FastAPI

GitHub

Google Cloud Platform(GCP)

BigQuery

PHP

Nginx

Next.js

PyTorch

TensorFlow

AWS

Swift

jQuery

Slack

CircleCI

Kotlin

育児支援制度あり

研修・勉強会あり

401k(確定拠出年金)あり

生成AI開発ツール導入

リモート可

フレックス勤務

時短勤務可

土日祝日休み

大規模トラフィック環境

QAエンジニア・テストエンジニア(テスター)×詳しい条件で求人を探してみる

開発言語

条件を変えて求人を探してみる