Role Overview
We're looking for an engineer who can adapt and extend GenAI architectures — training and testing modifications tailored to specific use cases and applications.
Responsibilities
- Develop Multimodal Architectures: Design, train, and test AI models capable of processing, understanding, and fusing inputs from multiple modalities (text, image, audio, video, etc.).
- Data Pipeline Design: Build scalable pipelines for data collection, temporal alignment, and normalization across modalities.
- Model Optimization: Improve performance, latency, and contextual accuracy of multimodal models in production environments.
- Architecture Modification: Adapt and fine-tune existing GenAI/foundation model architectures to meet specific application requirements.
Requirements
- Strong foundation in deep learning, LLM integration, and AI/ML programming frameworks (PyTorch).
- Hands-on experience fine-tuning foundation models.
- Experience with multimodal model architectures (e.g., vision-language models, audio-text fusion).
- Solid understanding of model evaluation, testing, and production deployment practices.
Nice to Have
- Experience with distributed training / large-scale model training.
- Familiarity with MLOps tools for pipeline automation and model monitoring.
Skills
- PyTorch
- LLM Integration
- MLOps
- Deep Learning
- GenAI