PESQUISA DE PONTA · 2026
Qwen nos bancos.
O estado da arte medido pela ciência: agentes autoevolutivos em e-banking, conformidade regulatória, prevenção à lavagem de dinheiro, antifraude e auditoria de demonstrações financeiras — o que os estudos mais recentes comprovam (e o que ainda não funciona).
Sete marcos da pesquisa com Qwen aplicada à banca
Agentes · ago/2026
Auditing Self-Evolution in Financial Agents
Auditoria dos frameworks de memória evolutiva SkillOpt, AWM e ReasoningBank em e-banking simulado sobre o Qwen 3.7 Flash. SkillOpt elevou a utilidade benigna de 0,741 para 0,837 — mas a exposição a conteúdo injetado subiu de 0,820 para 0,943 e a taxa de sucesso de ataques de 0,496 para 0,530. O ReasoningBank alcançou 0,859 de utilidade sem elevar a taxa agregada de ataques. Conclusão central: auditar agentes financeiros exige rastrear regressões, superfície de ataque, mudanças não autorizadas de estado financeiro e compatibilidade artefato-executor — acurácia sozinha não basta.
Banco de verdade · jan/2026
THaLLE-ThaiLLM: LLMs especializados em finanças pelo KBTG
O laboratório do banco tailandês KBTG demonstrou que model merging de Qwen-8B com ThaiLLM-8B e THaLLE-CFA-8B produz um modelo multicapacidade com ganhos simultâneos em benchmarks gerais e financeiros (Flare-CFA, Thai-IC). O estudo reforça por que bancos preferem deploy on-premise — privacidade, segurança e regulação — e apresenta o merge de modelos como alternativa eficiente ao treinamento de um modelo único monolítico.
Compliance · fev/2026
SOPBench: conformidade com procedimentos operacionais padrão
Benchmark de raciocínio sobre POPs em sete domínios regulados — incluindo bancos, com obrigações de compliance regulatório. O baseline Qwen-2.5-72B-Instruct alcançou 34,4% de aprovação; o método FM SO.P, com mistura progressiva de tarefas e avaliação multiagente, levou um modelo de 32B a 48,3% — mesmo desempenho com 10× menos parâmetros. Evidência de que raciocínio sobre processos e restrições, não tamanho, é o gargalo em fluxos bancários regulados.
Antifraude · jun/2026
Detecção de golpes em chamadas telefônicas com Qwen
No IEEE S&P 2026, pesquisadores avaliaram sete LLMs — incluindo Qwen Max, Plus e Turbo — no primeiro dataset público de 100 pares áudio-transcrição de chamadas de golpe em língua de baixos recursos. Resultado-chave para a banca: entradas baseadas em transcrição superam consistentemente o processamento direto de áudio, e transcrições corrigidas por humano performam de forma equivalente às não corrigidas — viabilizando pipelines de prevenção a fraudes em tempo quase real.
Auditoria · jun/2026
AuditFraudBench: julgamento de auditoria em demonstrações financeiras
Benchmark construído a partir de filings reais (10-K e 10-Q originais e re-apresentados, MD&A e AAERs da SEC) que avalia GPT, DeepSeek e Qwen em três tarefas: atribuição da fonte do resultado reportado, detecção de narrativas enganosas e classificação de mecanismos de fraude. Achado honesto e relevante: modelos abertos e proprietários ainda enfrentam dificuldade em raciocinar conjuntamente sobre números, framing de disclosure, evidências de restatement e mecanismos de manipulação — o humano permanece no loop.
PLD/AML · mai/2026
Servindo LLMs regulados em workloads de prevenção à lavagem de dinheiro
Estudo de engenharia de inferência sobre workloads de AML: com ajuste consciente de carga e quality gates determinísticos, o throughput saltou de 612–650 para 3.600 requisições/hora, a latência P99 caiu de 31–38 s para 6,4–8,7 s e a utilização de GPU subiu de 12% para 78%. A lição para bancos: performance em domínio regulado é problema de design de workload e serving — não apenas de escolha de modelo.
Conhecimento · ago/2026
WikiResearcher-9B: navegação em corpora estruturados com RL sobre Qwen
Agente WikiResearcher-9B, otimizado com reinforcement learning sobre um Qwen 9B, sintetiza corpora em wikis hierárquicas navegáveis e supera baselines não treinados do mesmo tamanho — igualando ou superando modelos externos maiores — em avaliações que incluem o FinanceBench, referência de perguntas e respostas sobre relatórios financeiros. Aplicação direta: consulta estruturada a regulatórios, manuais internos e documentações bancárias extensas.
O que isso significa para a operação bancária
Memória evolutiva exige auditoria por padrão
Agentes que aprendem com a experiência ganham utilidade — e ampliam a superfície de ataque. Bancos devem medir regressão, contato com conteúdo injetado e mudanças não autorizadas de estado financeiro em cada ciclo de evolução.
Modelos abertos, deploy on-premise
O caminho validado pelo KBTG: partir de pesos abertos Qwen e especializar via merge ou fine-tuning local, preservando dados sob a governança do banco — requisito de privacidade e regulação.
Compliance é raciocínio de processo
O gargalo no SOPBench não foi tamanho, e sim procedimento: misturas progressivas de tarefas e avaliação multiagente com rubricas elevaram um modelo de 32B ao nível de um 72B em fluxos regulados.
Fraude é multimodal — e a transcrição vem primeiro
Na detecção de golpes em ligações, transcrições superaram áudio bruto em todos os cenários testados. Pipeline recomendado: ASR para texto e depois o LLM de decisão, com modelos Qwen Max/Plus/Turbo por custo e latência.
Fontes primárias: arXiv (2608.17684, 2601.04597, SOPBench/FM SO.P, 2606.24523, 2606.08345, 2605.07156, 2608.29953) e IEEE S&P 2026. Os resultados citados são dos respectivos estudos, em seus próprios cenários de teste, e não constituem garantia de desempenho em produção. A Ativo Cloud é uma integradora independente: Qwen é marca do ecossistema Qwen/Alibaba Group, e as marcas citadas pertencem aos seus titulares.
PRÓXIMO PASSO