Tecnologia Aeriva

Deep Dive: Como unificamos Vercel, Kafka e Índices HNSW para acelerar as consultas de IA na Aeriva em 28%

Resumen

Como reduzir o tempo de resposta em buscas complexas por IA? Detalhamos a engenharia de performance por trás do motor da Aeriva: desde a otimização de brokers Kafka até o controle estrito de Core Web Vitals e renderização híbrida de dados.

Por Nicolas Dotti

Publicado porAeriva

Etiquetas

Search

Engenharia de Performance: Como reduzimos em 28% a latência do motor de busca contextual da Aeriva

Na transição para a era da inteligência contextual, a eficiência computacional deixou de ser uma métrica de infraestrutura e tornou-se o principal pilar da experiência do usuário.

Motores de busca tradicionais apoiam-se em índices invertidos rígidos, mas o ecossistema da Aeriva processa intenções humanas complexas em tempo real.

Recentemente, consolidamos uma arquitetura híbrida de busca semântica e processamento de eventos que reduziu em 28% o tempo de resposta (P99 latency) do nosso motor global.

Abaixo, detalhamos o deep dive técnico das otimizações implementadas, englobando desde o runtime na borda até a eficiência de custos na nossa malha de dados.

1. Otimização de Borda (Edge) e Renderização Híbrida com Vercel

Para sustentar a visão mapeada em nosso ecossistema sobre O Fim da Pesquisa por Destino, eliminamos o gargalo clássico da latência de rede (RTT - Round Trip Time). Adotamos uma infraestrutura baseada no framework da Vercel, aplicando o conceito de Incremental Static Regeneration (ISR) combinado com Edge Middleware.

  • Geodistribuição de Computação: Consultas contextuais complexas que não exigem reprocessamento do Large Language Model (LLM) central são interceptadas e resolvidas diretamente na Edge Network.
  • Melhoria no Crawling Budget: Como documentado nos benchmarks de impacto de performance da Vercel para motores de busca, o tempo de descoberta e indexação de páginas de hotéis e pontos de interesse caiu drasticamente. Ao responder com TTFB (Time to First Byte) sub-10ms na borda, otimizamos o processamento de bots e garantimos que a nossa malha de dados atualizada em tempo real seja indexada instantaneamente.

2. Orquestração de Dados: Eficiência Crítica com Apache Kafka

O motor da Aeriva processa bilhões de eventos de inventário, variações de preços e sinais contextuais de geolocalização. Nossa arquitetura orientada a eventos (Event-Driven Architecture) utiliza o Apache Kafka como barramento principal.

Para escalar esse volume sem explodir os custos operacionais de computação e memória, redesenhamos a topologia dos nossos clusters de microsserviços.

Implementamos uma estratégia inspirada em arquiteturas de alta eficiência no setor de turismo técnico — onde o desacoplamento rigoroso entre a ingestão de telemetria e o consumo de mensagens permitiu otimizar o ciclo de vida dos containers.

Com ajustes finos de batch.size, compressão via Zstandard (zstd) e o tuning fino do ciclo de vida de deployments de consumidores Kafka, conseguimos uma alocação dinâmica e ultra-eficiente de recursos de CPU.

Essa eficiência nos pipelines de dados liberou throughput crítico na nossa camada de dados para suportar a latência exigida pelo motor de busca contextual.

3. Core Web Vitals e Práticas Avançadas de Performance no Frontend

Não basta processar a query de IA em milissegundos se a interface do usuário sofre com gargalos de renderização. Alinhamos nossa engenharia de frontend com os padrões mais rigorosos do Google (Web.dev Performance Framework), focando nas métricas de Core Web Vitals:

  • Interaction to Next Paint (INP): Otimizamos a thread principal (main thread) do navegador quebrando tarefas longas de JavaScript durante a digitação de prompts de busca contextual. Utilizando requestIdleCallback() e estratégias rigorosas de code-splitting, garantimos que a interface responda imediatamente à intenção do usuário.
  • Largest Contentful Paint (LCP) e Cumulative Layout Shift (CLS): Elementos de mídia dinâmica e mapas de calor com os 30 pontos de interesse de cidades hub, como São Paulo, utilizam priorização de recursos via Fetch Priority API (fetchpriority="high"). Imagens e componentes de inventário têm dimensões estritas reservadas no DOM, anulando qualquer quebra de layout durante a renderização assíncrona dos resultados gerados por IA.

4. Arquitetura de Busca: Recuperação Híbrida e Inteligência Contextual

A verdadeira disrupção técnica do motor da Aeriva reside na nossa capacidade de ir além da busca por palavras-chave, consolidando os fundamentos da Era da Inteligência Contextual.

[ Prompt do Usuário ]


[ Edge Middleware ] ──(Cache Hit)──> [ Retorno Sub-10ms ]

(Cache Miss)

[ Hashing Vetorial Binário ]


[ Reranking por Grafo (HNSW) ] ──> [ Resposta Contextual ]

Para alcançar a redução de 28% no processamento dessas queries complexas, implementamos duas tecnologias de ponta em nossa camada de IA:

Quantização Vetorial e Índices HNSW Híbridos

A busca vetorial pura em embeddings de alta dimensão (ex: 1536 dimensões) gera alto custo de memória e processamento de CPU.

Substituímos a busca exaustiva por índices HNSW (Hierarchical Navigable Small World) otimizados com Quantização Escalar (SQ8) e Quantização Binária.

Isto reduziu o tamanho dos vetores no banco de dados vetorial em até 4x, permitindo que os cálculos de similaridade de cosseno ocorram quase inteiramente em cache L3 de memória.

Duas Camadas de Reranking (Two-Stage Retrieval)

A busca inicial recupera os top-100 candidatos semanticamente relevantes em microsegundos utilizando aproximação vetorial.

Em seguida, um modelo de Cross-Encoder ultra-leve e otimizado via ONNX Runtime realiza o reranking contextual dos top-30 resultados baseando-se no perfil em tempo real e contexto do usuário.

Conclusão

A redução de 28% no tempo de resposta do motor da Aeriva é o resultado direto da fusão entre a engenharia de infraestrutura moderna e o estado da arte em IA aplicada.

Ao unificar a eficiência de borda da Vercel, o tuning de arquiteturas orientadas a eventos e modelos avançados de busca vetorial quantizada, provamos que a inteligência contextual não precisa cobrar o preço da latência.

Continuamos quebrando as barreiras da computação de performance para garantir que o futuro do turismo e da descoberta de dados seja instantâneo, fluido e puramente inteligente.

devs@aeriva.io

Compartir

Por

Nicolas Dotti

CEO

Nicolas Dotti é fundador e CEO da Aeriva, uma empresa de inteligência artificial focada na transformação da experiência global de viagens. Com uma combinação rara de visão empreendedora e sólida formação técnica, Nicolas construiu sua carreira na interseção entre tecnologia, produto e inovação, desenvolvendo soluções digitais voltadas para escalabilidade, automação e experiência do usuário. Mais do que um executivo, Nicolas é um programador e hacker por formação. Ao longo dos anos, aprofundou seus conhecimentos em desenvolvimento de software, arquitetura de sistemas e inteligência artificial, com formação complementar em Python, Flutter e tecnologias modernas de construção de produtos digitais. Formado pela Universidad de Palermo, na Argentina, e participante da Escuela de Emprendedores da instituição, sempre manteve uma abordagem prática e orientada à engenharia, participando ativamente da concepção e desenvolvimento de plataformas tecnológicas. Na Aeriva, Nicolas lidera uma equipe multidisciplinar de engenheiros, designers e especialistas em viagens com a missão de aplicar inteligência artificial para eliminar a complexidade da indústria do turismo. Sua visão é construir uma nova camada de inteligência capaz de transformar grandes volumes de dados em decisões mais simples, rápidas e relevantes para viajantes em todo o mundo. Reconhecido por sua mentalidade de construtor, Nicolas acredita que as melhores empresas de tecnologia nascem quando engenheiros enxergam problemas considerados normais e se recusam a aceitá-los como inevitáveis. Essa filosofia orienta o desenvolvimento da Aeriva desde seus primeiros dias: criar tecnologia sofisticada que opere nos bastidores, tornando as viagens mais intuitivas, humanas e acessíveis.

Actualizado el 1 de julio de 2026

Deep Dive: Como unificamos Vercel, Kafka e Índices HNSW para acelerar as consultas de IA na Aeriva em 28% | Aeriva Newsroom