PrestaShop Inteligência Artificial

Thin Content Detector: Deteção de Conteúdo Pobre por IA no PrestaShop 8/9

O detetor de conteúdo pobre que transforma as suas páginas fracas em páginas que se posicionam

O Google penaliza as páginas com conteúdo demasiado curto ou demasiado semelhante. Num catálogo com centenas de produtos, isso é invisível a olho nu. O Thin Content Detector analisa automaticamente todos os produtos, categorias e páginas CMS em todas as línguas ativas, identifica três padrões tóxicos para o SEO e gera sugestões de enriquecimento por IA prontas a colar.

PrestaShop 8 e 9 Multilingue IA integrada Cron nativo
  • Reembolso em 30 dias
  • 12 meses de atualizações
  • Suporte em 24h
www.datafirefly.com/pt/
Deteção das fichas com conteúdo pobre (thin content) no PrestaShop
v1.0.0 · atualizado 2026-05-27
O que faz

A versão curta.

01

Deteção de conteúdo pobre

Identifica os produtos, categorias e páginas CMS abaixo do limiar de palavras configurável (por defeito 150 palavras em produto, 100 em categoria, 250 em CMS). Gravidade crítica / aviso / notificação, consoante a distância ao limiar.

02

Deteção de duplicados

Identifica as descrições idênticas (hash SHA1) ou muito próximas (semelhança Jaccard ≥ 85%, configurável) entre produtos. Indispensável para catálogos com muitas variantes.

03

Rácio modelo / conteúdo

Deteta as páginas dominadas por texto repetido: demasiados tokens partilhados com as páginas irmãs e poucos tokens únicos. A armadilha clássica do copiar e colar categoria a categoria.

04

Sugestões de IA prontas a colar

Para cada problema detetado, gera uma sugestão de enriquecimento adaptada ao tipo de problema e ao tipo de objeto. Saída em HTML limpo, sem markdown.

A versão longa

Tudo o que quer saber antes de instalar.

Uma análise detalhada de como o Thin Content Detector: Deteção de Conteúdo Pobre por IA no PrestaShop 8/9 funciona, porque o construímos assim e o raciocínio por trás das funcionalidades acima.

§ 01

Porque é que o conteúdo pobre prejudica o seu SEO

Desde o Helpful Content Update, o Google despromove ativamente as páginas com conteúdo demasiado pobre, demasiado semelhante ou demasiado dominado por elementos repetidos. Numa loja de comércio eletrónico, são tipicamente as fichas de produto copiadas do fornecedor, as categorias com duas frases genéricas, ou as variantes que partilham 95% da descrição. Invisível a olho nu num catálogo de 500 produtos, mas, somado, é o que impede o site de se posicionar.

§ 02

Três tipos de deteção complementares

O Thin Content Detector não se limita a contar palavras. O analisador de conteúdo pobre assinala as páginas abaixo do limiar. O detetor de duplicados usa um hash SHA1 para os duplicados exatos e, depois, uma semelhança Jaccard para os quase duplicados. O analisador de rácio de modelo identifica os tokens que aparecem em mais de metade das páginas irmãs (mesma categoria-mãe) e calcula a percentagem de tokens únicos por página. Uma página com 200 palavras mas 90% de texto repetido é tão prejudicial como uma página de 30 palavras.

§ 03

Sugestões de IA contextualizadas

Para cada problema detetado, o módulo gera uma sugestão de enriquecimento através de um endpoint compatível com a OpenAI. O prompt é adaptado ao tipo de problema (enriquecer o conteúdo pobre, diferenciar os duplicados, tornar único o conteúdo demasiado repetido) E ao tipo de objeto (argumentos e especificações para os produtos, argumentos de gama para as categorias, desenvolvimento editorial para as páginas CMS). O resultado é HTML limpo, com parágrafos, listas e subtítulos, diretamente colável no TinyMCE. Sem markdown para limpar.

§ 04

Endpoint de IA agnóstico

Configure qualquer serviço compatível com a API chat completions da OpenAI: OpenAI direto, Mistral AI, Groq para respostas muito rápidas, Ollama local para custo zero em tokens, ou Anthropic através de um proxy compatível. Mantém o controlo do fornecedor, do modelo e do custo.

§ 05

Concebido para catálogos grandes

Todas as consultas SQL são divididas em blocos (500 produtos por lote). A exportação CSV é feita em streaming, para evitar saturar a memória. A deteção de duplicados usa uma pré-filtragem por número de palavras (±50%) antes de calcular a semelhança Jaccard, e um limite de segurança de 1500 itens impede qualquer complexidade O(n²) catastrófica. Num catálogo de 5000 produtos, uma análise completa demora alguns minutos.

§ 06

Cron protegido e nova análise automática

Um endpoint de cron protegido por token permite-lhe agendar as análises noturnas no crontab. Ative a nova análise automática para que cada gravação de produto, categoria ou página CMS desencadeie um novo teste dirigido, e veja em tempo real se a reescrita chega para ultrapassar os limiares.