Multimodal AI Systems Architect (AI Engineering)
✨ AI Summary
hyphen-connect-limited is hiring a Multimodal AI Systems Architect to develop AI systems integrating vision and audio models for voice-to-voice interactions and multimodal retrieval. Tech stack includes Whisper, CLIP, multimodal LLMs, streaming architectures, and WebRTC. Requires expertise in cross-modal alignment and experience with these technologies, based in the San Francisco Bay Area.
We are seeking a talented Multimodal AI Systems Architect to develop and optimize AI systems that seamlessly integrate vision and audio models. This role focuses on enhancing our voice-to-voice interactions and multimodal retrieval capabilities, ensuring our systems are efficient and innovative.
Responsibilities:
- Integrate vision encoders and audio-native models into core agent reasoning loops.
- Optimize streaming latency for voice-to-voice AI interactions.
- Architect multimodal RAG systems capable of retrieving insights from videos and PDFs.
Qualifications:
- Experience with Whisper, CLIP, and multimodal LLM integration.
- Knowledge of streaming architectures and WebRTC.
- Expertise in cross-modal alignment.
About the Company
No detailed information available about this company.
More jobs at Hyphen Connect Limited
-
Web3 Frontend Developer (UX)
APAC · Contract · Aug 19, 2026
-
Smart Contract Developer (DEX) - Remote/ Mandarin Speaking
APAC · Contract · Aug 19, 2026
-
Founding Mobile Development Lead (Game/ React Native/ Mandarin speaking)
APAC · Contract · Aug 19, 2026
-
MLOps & Agentic Platform Engineer (AI Infrastructure)
San Francisco Bay Area, USA · · Aug 19, 2026
-
MLOps & Agentic Platform Engineer (AI Infrastructure)
Oregon, USA · · Aug 19, 2026