Synthetic Data Engineer (AI Data/Training)

Location: San Francisco Bay Area, USA
Type:
Posted: Aug 19, 2026
Views: 4

✨ AI Summary

hyphen-connect-limited, operating in the AI data and training domain, is hiring a Synthetic Data Engineer in the San Francisco Bay Area. The role focuses on designing synthetic data generation pipelines, implementing quality scoring and de-duplication, and managing data flows for SFT and DPO training. Tech stack includes Airflow, Spark, and Ray, with deep prompt engineering expertise required. Proven experience in large-scale data pipelines and familiarity with dataset distillation and bias mitigation are top qualifications.

We are seeking a talented and innovative Synthetic Data Engineer. In this role, you will design and implement domain-specific synthetic data generation pipelines, ensuring high-quality data management for training loops. Your expertise will drive the success of data processing and model training within the organization.

Responsibilities:

  • Design domain-specific synthetic data generation (SDG) pipelines via self-instruct and constitutional prompting.
  • Implement automated quality scoring and de-duplication systems.
  • Manage data pipelines that feed directly into SFT and DPO training loops.

Qualifications:

  • Proven experience building large-scale data pipelines (Airflow, Spark, Ray).
  • Deep knowledge of prompt engineering for data generation.
  • Familiarity with dataset distillation and bias mitigation.

About the Company

Name: Hyphen Connect Limited

No detailed information available about this company.

More jobs at Hyphen Connect Limited