Ingeniero de software | Teletrabajo en León, España is listed on Jobeax. Browse 80,000+ vacancies available.
Una compañía con equipos de IA avanzada incorpora un/a AI Runtime & Evaluation Engineer para el diseño, implementación y evaluación de arquitecturas de agentes de IA a escala productiva. Rol clave en la creación de sistemas robustos de evaluación y benchmarking de LLMs, gestión del runtime de agentes y observabilidad avanzada. Rol fundamental en el ciclo de vida de sistemas de agentes IA en producción real — no POCs, no research aislado.
Por favor, asegúrese de leer completamente el resumen y los requisitos de esta oportunidad de empleo que se detallan a continuación.
Sobre el ro
lSerás responsable de construir, optimizar y validar rigurosamente sistemas de agentes de IA. Diseñarás las arquitecturas, gestionarás su runtime end-to-end, y — muy importante — establecerás la metodología de evaluación que asegura calidad, rendimiento y reproducibilidad. Impacto tangible en la fiabilidad de soluciones IA a escala
?? Lo que har
ás
Arquitecturas de agent
- es:Diseñar sistemas de agentes: planning, tool calling, function calling, memory, context engineering, semantic routi
- https://jobeax.com/link/Msvtw6fp6c3mJi7q y diseñar workflows vs agentes según caso de u
- https://jobeax.com/link/FbqMbTmp3vzI4yFU con MCP (Model Context Protocol) y, idealmente, A
- https://jobeax.com/link/W63Szr3nBL5VzCAq sistemas multi-agen
te.
Runtime de agen
tes:Gestionar execution loop, state management, orchestration, retries, checkpoint
https://jobeax.com/link/XcRCfmPHJCSLFZ81 streaming, human-in-the-loop, gestión de conte
https://jobeax.com/link/v0SHHbTTdK42WTi4 avanzada, tracing, tool execution, concurre
ncy.
Evaluación (crít
ico):Diseñar evals offline y on
https://jobeax.com/link/7HUJV9BHWTZOFlGX benchmarks robustos + golden datasets + synthetic data
https://jobeax.com/link/X9JBhOsfkY7RCYJh LLM-as-a-judge, pairwise compar
https://jobeax.com/link/nc68t3In0amWQbU8 testing + experiment tracking + reproducibilidad (MLf
low)
~ . RAG:Chunking, embeddings, reranking, vector databases, retrieval quality, context wi
ndows.
LLM Engin
eering:Prompting, structured outputs, JSON schema, function c
alling.Optimización de tokenización, coste, latencia, c
https://jobeax.com/link/8dhu7xyB2C6saaO3 models + context window mana
gement.
Backend + Observabilidad +
Testing:Python backend con FastAPI, Docker, Kub
https://jobeax.com/link/jVakLx39ep8h14gj + Grafana + Pro
https://jobeax.com/link/7n3bnjX3sWgCHg2G testing, integration testing, eval testing, regression suites, CI/CD
pa ra IA.
Impres
cindiblesExperiencia sólida d iseñando arquitecturas de a gentes IA en producción (planning, tool/function calling, memory, context engineering, semantic routi
ng, MCP).Experiencia prác tica con runtime d e agentes end-to-end (execution loop, state, retries, checkpointing, streaming, HITL, conc
urrency).Experiencia cr ítica en evaluación d e modelos: offline + online evals, benchmark design, golden + synthetic datasets, LLM-as-a-judge, regression testing, experiment
https://jobeax.com/link/dvBTT25FJ6KUfim6 ava nzado de Python para backend
https://jobeax.com/link/q6TIA2GzedhmY1p8 ex per to de RAG (chunking, embeddings, reranking, vector DBs, retrieval
quality).LLM En gineering avanzado (prompting, structured outputs, function calling, tokenización, coste, latencia, caching, reasoning
models).Experie ncia c on MLflow para experiment
tracking.Inglés
av anzado
Muy
valorableFrameworks de agentes: LangGraph, OpenAI A
gents SDK.A2A (Agent-to-Agent
Protocol).Infraes tructura: FastAPI, Docker, Kubernetes, Redis, Kafka, P
https://jobeax.com/link/I3VfRbKLae2y2Ea8 abilidad: OpenTelemetry, Grafana, P
rometheus.Testing: unit + integration + eval + regression suites + CI/C
D para IA. Cloud AI: Azure OpenAI, AWS Bedrock + AgentCore, GCP
Ver tex AI.
CondicionesModalidad: freelance v
ía Shakers.Duración: 12 meses con alta probabilidad de
extensión.Ubicación: 100% remoto de
sde España.
En Shakers nos ocupamos de la gestión del proyecto, la facturación y el acompañamiento. xbhjioe Tú te centras en construir agentes IA fiables y evaluables a escala
productiva.