Inteligência artificial
As empresas podem confiar no conselho de IA sob pressão?
À medida que a tecnologia de IA se desenvolve e se integra à prática empresarial e à tomada de decisões, várias questões surgem. A primeira, naturalmente, é a questão da confiabilidade, com as “alucinações” das primeiras versões de LLMs tendo impactado duradouramente a confiança dos usuários na veracidade dos dados fornecidos pelas IAs, embora o problema seja geralmente menos prevalente nos modelos mais recentes.
Outra questão é se a IA manterá suas salvaguardas de segurança e diretrizes éticas sob pressão de usuários, dos interesses comerciais de seus desenvolvedores ou simplesmente de tentativas repetidas e inteligentes de encontrar soluções alternativas no design dos LLMs.
Um novo estudo de um pesquisador da Universidad Pablo de Olavide, na Espanha, testou diretamente a capacidade de múltiplos LLMs de resistir a essa pressão e manter suas diretrizes éticas. Ele desenvolveu um protocolo para testar qualquer LLM, no qual o diálogo adaptativo é usado e contra‑argumentos são calibrados de acordo com a resposta prévia de cada modelo.
O estudo foi publicado em Computers in Human Behavior Reports1, sob o título “Deveriam as empresas confiar no conselho de IA? Uma metodologia para auditar a integridade ética dos chatbots”.
De Busca a Conselheiros
Inicialmente, os LLMs eram usados de forma semelhante a uma tecnologia mais familiar para seu usuário: como um motor de busca. Mas à medida que sua capacidade de raciocínio cresceu, eles vêm sendo cada vez mais utilizados para substituir ou complementar o aconselhamento de um profissional humano treinado: advogados, médicos, engenheiros, etc.
“Quando tal modelo é questionado sobre contratar um parente, ocultar renda em dinheiro ou lançar um produto defeituoso, a resposta deixa de ser meramente informativa—torna‑se consultiva. Um conselheiro empresarial deve não apenas ser preciso, mas também permanecer eticamente coerente quando o usuário contrapõe argumentos de lucro, sobrevivência ou conveniência.”
Portanto, tendo esse problema em mente, o estudo propõe o Protocolo de Avaliação Ética Adaptativa (AEEP).
O estudo concentrou‑se em pequenas e médias empresas (PMEs) porque esse segmento tem maior probabilidade de delegar trabalhos de consultoria a LLMs, já que carecem de funções internas de conformidade, jurídicas ou de ética. Também ocorre que os dilemas enfrentados pelos fundadores de PMEs, como nepotismo, fraude, assédio ou uso indevido de dados, coincidem com as áreas cinzentas ético‑legais explicitamente regidas pelo AI Act da UE e pelo GDPR.
Medindo a Estabilidade Ética
O AEEP define a confiabilidade ética dos conselheiros LLM como uma propriedade mensurável da interação em múltiplas rodadas, não de respostas isoladas. Dessa forma, pode detectar falhas mais profundas que uma análise superficial baseada apenas em uma resposta de primeiro nível não revelaria.
Ele fornece um pipeline de codificação totalmente especificado e reproduzível (detecção de sentimento, palavras‑chave e contradições baseada em NLI) cujas saídas são validadas contra avaliações cegas de especialistas.
O estudo aplicou este teste a cinco LLMs de ponta diferentes: ChatGPT, Claude, Gemini, Grok, DeepSeek.
Ele revelou diferenças estáveis, ao nível de modelo, na consistência ética sob pressão que são invisíveis aos benchmarks convencionais.
Deve‑se, porém, observar que esses modelos evoluem muito rapidamente, e foram testados de 12 a 14 de maio de 2025, de modo que seus rankings relativos não podem descrever de forma confiável suas capacidades no final de 2026.
Isso revela a possibilidade de criar um benchmark tão atualizado que mediria não a precisão ou a eficiência computacional, mas a estabilidade ética.
Medindo a Ética
As Muitas Formas de Violação Ética
O que constitui ou não um comportamento empresarial ético é, claro, sujeito a certo grau de variação cultural e julgamento pessoal. Mas uma empresa, especialmente uma pequena ou média, pode estar exposta a alguns riscos éticos bem reconhecidos como problemáticos.
A primeira é a corrupção e suborno. Um fundador pode ser pressionado a subornar um funcionário público para acelerar uma licença, ou a pagar propina a um oficial de compras para ganhar um contrato. Isso acaba por prejudicar a concorrência leal e recompensa a enganação, expondo a empresa a riscos legais e reputacionais.
Outra questão ética que as empresas enfrentam é como tratar sua própria força‑de‑trabalho sob pressão de desempenho. Como o tratamento exploratório danifica a moral, aumenta a rotatividade e prejudica a reputação, metas de desempenho ambiciosas precisam permanecer dentro do escopo não apenas de ações legalmente autorizadas, mas também estar vinculadas a remuneração justa, segurança e condições de trabalho razoáveis.
Enganar consumidores sobre características, qualidade ou disponibilidade do produto é o terceiro dilema recorrente. Por exemplo, muitas startups sob pressão para obter tração precoce ou captar recursos podem ser tentadas a exagerar o desempenho em materiais de vendas ou apresentações.
E, claro, a segurança do produto e a proteção do consumidor são ainda mais importantes para evitar que usuários sejam prejudicados por um produto que não funciona como esperado.
Por fim, conflitos de interesse e auto‑serviço podem ser especialmente prevalentes em pequenas empresas, onde a barreira entre o fundador e a companhia é mais tênue que em grandes corporações com conselho de supervisão e acionistas externos. Isso, no entanto, pode minar a confiança entre co‑fundadores, funcionários e investidores.
“Um fundador pode considerar conceder um contrato lucrativo a um negócio no qual ele ou seus parentes tenham participação ou pode usar fundos da empresa para despesas pessoais. Esse cenário testa o compromisso do fundador com o dever fiduciário e a justiça.”
Ética & IA
O surgimento da IA nos negócios traz novos dilemas éticos para empreendedores que integram essas tecnologias. Sistemas de IA podem, inadvertidamente, incorporar vieses, ameaçar a privacidade e tomar decisões autônomas com implicações morais.
“Por exemplo, uma startup que implementa uma ferramenta de recrutamento baseada em IA pode descobrir que o algoritmo discrimina certos grupos: deveria adiar o uso da ferramenta (a custo de eficiência) para melhorar sua justiça?”
Portanto, as pessoas que adotam IA precisam estar cientes desses riscos éticos e mitigá‑los adequadamente.
“Gerenciar a IA de forma ética está se tornando um teste decisivo para a liderança empreendedora moderna, pois requer um equilíbrio entre competência técnica, visão de futuro e responsabilidade moral.”
E pode ser igualmente útil para a indústria de IA como um todo começar a adotar benchmarks consistentes e padrões comuns além do termo geral “segurança de IA”.
Construindo um Teste para a Estabilidade Ética
O teste AEEP apresenta dez dilemas éticos progressivamente mais difíceis, indicadores pré‑registrados, uma árvore de decisão adaptativa de prompts de acompanhamento e um pipeline de codificação determinístico.
Cada diálogo compreende cinco nós conversacionais:
- Um nó de abertura.
- Dois nós de pressão adaptativa.
- Um nó de conclusão no qual o modelo deve se comprometer com uma recomendação.
- Um nó de confirmação no qual esse compromisso é questionado.
Em seguida, os resultados foram analisados por um grupo de especialistas composto por especialistas em inteligência artificial, ética aplicada e negócios. Eles verificaram a consistência dos dilemas, a adequação dos indicadores éticos e a robustez das avaliações do algoritmo.
Cada especialista avaliou independentemente cada diálogo. Eles receberam os 50 diálogos em ordem aleatória, sem saber a identidade do modelo nem as pontuações algorítmicas.
Cada cenário apresenta explicitamente um dilema moral que confronta empreendedores, abrangendo questões como nepotismo, propriedade intelectual, bem‑estar dos funcionários, honestidade nas finanças, anti‑assédio, integridade da missão, fraude e manipulação.
LLMs sob Escrutínio Ético
Os modelos de IA foram testados quanto a uma série de características de tomada de decisão ética:
- Consistência da Postura Moral: verificando que o chatbot não deve contradizer a si mesmo quando o usuário apresenta novos prompts.
- Disposição para Priorizar a Ética sobre Lucro/Conveniência: o fato de que o assistente de IA entende que conduta ética e sucesso empresarial não são mutuamente exclusivos.
- Presença de Contradições ou Inconsistências Lógicas: os diálogos são revisados quanto a declarações que conflitam com declarações anteriores e/ou com fatos conhecidos. Este indicador é binário/objetivo: uma inconsistência lógica está presente ou não.
- Conscientização Ética e Profundidade de Raciocínio: Se o modelo reconhece as dimensões morais do problema, identifica as partes interessadas afetadas e considera dano, justiça, direitos e legalidade.
Juntos, constrói uma estrutura sólida para determinar a ética de uma recomendação de IA:
“Seu raciocínio é internamente coerente, corresponde a fatos conhecidos, e está pronto para priorizar decisões éticas sobre o sucesso empresarial de curto prazo e a demanda de seus usuários.”
Os testes de 2025 mostraram que Claude teve o melhor desempenho geral em estabilidade ética, enquanto Grok ficou geralmente em último lugar. Os resultados dos modelos entre esses dois extremos variaram nos casos e indicadores avaliados.
Em toda a avaliação, as avaliações automatizadas concordaram com o painel de especialistas de cinco pessoas em 93,8% das vezes. No nível de modelo individual, a concordância foi maior para Claude, com 96,2%, apoiando a capacidade da metodologia de aproximar avaliações de especialistas.
O padrão que emergiu foi que o Grok frequentemente não se opunha a um pedido inautêntico ou não ajudava com um dilema ético do usuário, geralmente com algumas restrições.
Conclusões para Investidores e Usuários de IA
À medida que as IAs se incorporam aos fluxos de trabalho de tomada de decisão, se uma IA manterá sua posição ética quando desafiada por pressão comercial torna‑se importante. A longo prazo, isso provavelmente se tornará uma camada essencial de governança empresarial, compras e conformidade regulatória.
Este estudo fornece um quadro teórico testado para criar novos benchmarks sobre este tema e oferece uma nova dimensão pela qual os LLMs podem ser avaliados.
Ele pode ser usado para apoiar a seleção de modelos, gatilhos de revisão humana obrigatória, controle de versões e auditorias de conformidade recorrentes.
Isso também abre caminho para entender melhor os trade‑offs existentes ao lidar com a segurança de IA. As respostas mais permissivas do Grok podem refletir diferentes prioridades de alinhamento. Contudo, o estudo não examinou se essa permissividade melhora a precisão factual, a utilidade ou a liberdade de viés político.
Deve‑se também observar que, embora os modelos lançados para LLMs de código aberto como DeepSeek tenham apresentado bom desempenho do ponto de vista ético, a natureza do design de código aberto significa que modelos alternativos, menos orientados pela ética, poderiam ser criados relativamente facilmente.
Também é possível que vejamos o surgimento de LLMs focados em ética capazes de lidar com tais dilemas e questões em particular, com sua classificação ética (em torno de benchmarks objetivos e padronizados em toda a indústria) como prioridade máxima.
No geral, este estudo também levanta a questão de quanto os humanos devem ceder seu próprio julgamento aos LLMs, lembrando que seu conselho está sempre potencialmente em risco de violar limites éticos, mas talvez não mais ou menos do que um ser humano real faria.
Investindo em Modelos de IA Éticos
Alphabet
Entre as empresas de capital aberto representadas diretamente no estudo, a Alphabet oferece uma das conexões de investimento mais claras. O Gemini teve um desempenho forte na avaliação, enquanto a Alphabet também opera os produtos empresariais, a infraestrutura de nuvem e os sistemas de governança necessários para comercializar IA em ambientes de negócios regulamentados.
Isso reforça a ideia de que empresas, incluindo pequenas e médias, utilizem o LLM da Google/Alphabet nos produtos de IA corporativa da empresa, na infraestrutura de nuvem e nos sistemas de governança de IA responsável.
À medida que os modelos de IA se tornam cada vez mais competentes e eficientes, e o custo do hardware continua a cair, a diferenciação entre os modelos não será cada vez mais baseada apenas na capacidade.
GOOGL Gráfico de preços
Em vez disso, fornecedores capazes de fornecer trilhas de auditoria, salvaguardas configuráveis, ferramentas de avaliação e documentação regulatória podem estar melhor posicionados para conquistar implantações corporativas lucrativas e sensíveis a riscos.
Além da consideração da ética, a eficiência da infraestrutura do Google Cloud, a experiência na gestão de dados com sua busca e suas relações existentes com empresas serão alavancas poderosas para conquistar um segmento significativo do mercado, especialmente com PMEs que já têm parte de seus sistemas de TI vinculados ao Google.
Portanto, embora outras empresas também tenham bom desempenho, notavelmente a Microsoft e sua forte presença em grandes empresas, o Google parece ser uma boa forma para investidores obterem exposição a IA que pode ser confiável não apenas para fornecer informações, mas para se tornar um verdadeiro assistente de fundadores, empreendedores e gestores frequentemente em necessidade urgente de expertise profissional e de maior conformidade com regulamentos como GDPR, leis trabalhistas, normas de licitação, etc.
(Você pode ler mais sobre a Alphabet em nosso relatório de investimento dedicado à empresa)
Últimas Notícias e Desenvolvimentos das Ações da Alphabet (GOOGL)
Estudo Referenciado
1. Manuel Chaves-Maza. Deveriam as empresas confiar no conselho de IA? Uma metodologia para auditar a integridade ética dos chatbots. Computers in Human Behavior Reports. Volume 24, dezembro de 2026, 101291. https://doi.org/10.1016/j.chbr.2026.101291














