一键重装系统工具 | U盘启动盘制作工具 | 误删文件恢复软件 | 硬盘数据抢救专家 | 电脑蓝屏修复助手 | C盘空间清理神器 | 电脑驱动离线安装工具 | 微信聊天记录恢复工具 | 照片误格式化恢复 | 电脑密码破解清除工具 | 系统崩溃紧急救援盘 | 电脑加速优化大师 | 电脑开不了机怎么重装系统 | 回收站清空了怎么恢复 | 硬盘分区丢失数据恢复 | 电脑卡顿重装系统有用吗 | U盘插入提示格式化数据恢复 | 电脑中毒文件被隐藏恢复 | 忘记电脑开机密码怎么办 | 新硬盘分区对齐工具 | 旧电脑装Win10流畅工具 | SD卡照片删除恢复免费版 | 移动硬盘打不开提示损坏修复 | 电脑无故重启系统修复工具 | 电脑小白一键重装神器 | 程序员电脑环境配置助手 | 设计师电脑字体/素材恢复工具 | 网吧网管系统维护工具箱 | 财务人员电脑发票备份恢复 | 学生党免费电脑系统安装包 | 电脑维修师傅必备工具盘 | 游戏玩家电脑性能优化助手 | 办公白领误删文档恢复软件 | 自媒体视频素材恢复工具 | 网课录制视频损坏修复工具 | 最好的U盘PE系统排名 | 数据恢复软件哪个最强 | 免费电脑助手与收费版区别 | 国产装机工具哪款无广告 | 离线版驱动助手推荐 | 轻量级电脑优化工具对比 | 支持NVMe驱动的PE工具 | 带网络功能的应急启动盘 | 2026最新版万能装机工具 | 支持Win11 24H2的PE工具 | 最新免激活系统重装工具 | 2026数据恢复软件破解版合集 | 纯净无捆绑装机助手V3.0 | 支持苹果M芯片的电脑助手 | 秋季更新版系统维护工具箱 | 电脑系统崩了怎么用U盘把重要资料拷贝出来 | 重装系统前哪些文件夹必须备份 | 固态硬盘误格式化还能恢复数据吗 | 如何制作一个既带PE又能存数据的双分区U盘 | 电脑总是弹窗广告用什么助手彻底拦截 后台管理
📢 欢迎访问系统之家!所有资源均经过安全检测。

Deve continuar a dar importância à qualidade da tradução ?

发布时间:2026-09-21 | 浏览:1
📥 下载地址(文章开头)
装机神器,一键装机,安装任何系统。纯净版,原版,软件版,精简版,英文版。
Se pedir informações sobre a qualidade de qualquer serviço de tradução baseada em IA, é provável que indiquem um número. Normalmente, indicam um número até 100. Calcula-se frequentemente através de uma das fórmulas convencionais para classificar a qualidade da tradução. Irá parecer uma visão simples, objetiva e definitiva sobre quais são as "melhores" traduções e de que prestador. Além disso, quase de certeza que irá apresentar no topo da lista as traduções do prestador de serviços com que está em contacto. Após décadas a ouvir afirmações como "os dados são soberanos", agora também sabemos que os dados podem ser interpretados da forma que melhor convém a quem os apresenta. Vou ser sincera. Se pedir à DeepL informações sobre a qualidade da tradução, irá obter a mesma resposta. Iremos partilhar a análise comparativa aprofundada da qualidade que realizámos em março, a qual incluiu 48 000 testes cegos com peritos em idiomas e que revelou que o DeepL ganhou 94% dos grupos de testes em 16 combinações de idiomas e contra os cinco principais concorrentes, incluindo todos os LLM mais poderosos. Não temos motivos para nos desculparmos por isso. No entanto, há algo que ninguém na área da tradução baseada em IA gosta de admitir. É uma verdade inconveniente que é varrida para debaixo do tapete sempre que os resultados dos testes são divulgados. Estamos a medir diferenças de qualidade que se estão a tornar cada vez menores. São tão pequenas que algumas pessoas poderão argumentar que não têm importância. Atualmente, todas as traduções baseadas em IA de textos escritos são, em termos gerais, de boa qualidade. São poucos os erros que uma pessoa não especializada conseguiria detetar à primeira vista. As diferenças são mínimas, subtis e bastante subjetivas. É em parte por isso que existem tantas classificações diferentes e que é fácil encontrar uma classificação que favoreça os modelos líderes. Então, ao escolher um fornecedor de tradução baseada em IA, deve continuar a dar importância à qualidade enquanto fator diferenciador? Na minha opinião, sim, no entanto, a qualidade, tal como é medida por resultados de testes, não deveria ser o principal foco. Existe uma diferença crescente entre o desempenho da tradução baseada em IA em testes de qualidade uniformizados e o seu desempenho na prática, tanto para a sua organização como para o seu conteúdo. Em testes, as diferenças de qualidade parecem mínimas. Na prática, as diferenças são muito maiores e têm impactos empresariais muito concretos. O que medem os testes de qualidade da tradução baseada em IA Analisemos de perto o que os testes de qualidade uniformizados realmente medem, como o fazem e, ainda mais importante, o que não incluem. Quando uma tradução é avaliada por linguistas, normalmente utilizam o sistema MQM (Multidimensional Quality Metrics), que inclui oito dimensões diferentes da qualidade da tradução. Ao atribuir métricas a estas diferentes dimensões e ao definir a ponderação de cada uma, é possível criar uma fórmula que representa a qualidade matematicamente, através de uma pontuação expressa num único número. As dimensões do MQM incluem a precisão (até que ponto uma tradução para um idioma de destino corresponde ao conteúdo de um texto original no respetivo idioma de origem) e elementos como a fluência da tradução (a naturalidade com que a tradução flui no idioma de destino), a terminologia específica do setor (se os termos especializados estão corretos), a forma como reflete o estilo, se segue as convenções locais, entre outros. O que significam as diferentes fórmulas de qualidade da tradução Recorrer a linguistas especializados para avaliar traduções é complicado e dispendioso. Na prática, muitas das classificações de qualidade da tradução associadas a fornecedores de IA não recorrem de todo a avaliações realizadas por humanos. Em vez disso, utilizam um dos seguintes sistemas de classificação automatizados. Ao longo dos anos, estes têm-se tornado cada vez mais sofisticados. Em 2001, a IBM apresentou o BLEU (Bilingual Evaluation Understudy). Este sistema analisa em que medida uma tradução automática corresponde a uma tradução humana do mesmo texto original. O problema? Parte do princípio de a tradução de referência é a melhor tradução possível e que qualquer desvio constitui um erro. Em 2006, este sistema foi adaptado para a avaliação de TER (Translation Edit Rate), que conta o número de edições que um tradutor humano teria de efetuar para transformar a tradução automática numa tradução humana. É semelhante ao BLEU, no entanto, neste sistema, os valores mais baixos são melhores. A Unbabel apresentou o COMET (Crosslingual Optimized Metric for Evaluation of Translation) em 2020, utilizando um modelo de rede neuronal para comparar uma tradução automática com uma tradução humana e com o texto original. Este sistema recorre ao texto original para tentar determinar o significado, algo que o BLEU e o TER não fazem. A avaliação automatizada entrou na era dos LLM em 2023 com o lançamento do GEMBA (GPT Estimation Metric Based Assessment), que solicita aos LLM que apliquem as diferentes dimensões do MQM a uma tradução e determinem o respetivo desempenho. A avaliação automatizada de traduções tem vindo a evoluir, tornando-se cada vez mais útil, no entanto, ainda não consegue igualar totalmente o discernimento de peritos humanos. Quando os LLM assumem a pesada tarefa da avaliação da qualidade, deparam-se com problemas de parcialidade, favorecendo consistentemente as traduções produzidas pelo seu próprio modelo, mesmo que estas não sejam totalmente precisas. Tal deve-se, em parte, à natureza subjetiva da qualidade da tradução. Na prática, um modelo de IA está a corrigir o seu próprio trabalho de tradução e a decidir que a sua própria solução foi a melhor. Na WMT25, a décima edição de uma conferência anual dedicada à avaliação automatizada, chegou-se a uma conclusão muito clara a este respeito: "Os sistemas que obtiveram os melhores resultados nas métricas automatizadas não se revelaram consistentemente vencedores na avaliação humana, o que aponta para um enviesamento persistente nas métricas e reforça a ideia de que a avaliação humana deve continuar a ter a última palavra na avaliação da qualidade da tradução."
📥 下载地址(文章中间)
装机神器,一键装机,安装任何系统。纯净版,原版,软件版,精简版,英文版。
Por outras palavras, se realmente quiser saber mais sobre a qualidade da tradução, pergunte a um perito humano (tal como a DeepL faz nos testes de referência). À medida que as diferenças na qualidade da tradução baseada em IA se tornam cada vez menores, o discernimento humano sobre como equilibrar todos os diferentes elementos torna-se cada vez mais valioso. As diferenças de qualidade já não são evidentes. Pelo menos, não o são nos testes de qualidade padrão. O que os testes de qualidade de tradução não têm em conta: contexto, determinismo e coerência Tal como referi, a qualidade da tradução medida nos testes não é a mesma que a qualidade da tradução com que se depara na prática, especialmente quando se gere a tradução e localização numa organização complexa. Na verdade, são os aspetos da qualidade da tradução que os testes não medem que têm o maior impacto empresarial. A maioria dos sistemas de pontuação que mencionei neste blog são "analíticos". Funcionam frequentemente através da comparação de "segmentos" do texto original e do texto traduzido, que, normalmente, correspondem apenas a frases individuais. Também avaliam a qualidade da tradução de cada frase isoladamente, como se esta não tivesse qualquer relação com as frases que se encontram noutras partes do texto. A nossa experiência real ao consumir conteúdo traduzido não se assemelha de todo a isto. É uma experiência "holística". Inclui não só a frase que estamos a ler nesse momento, mas todo o texto de que faz parte. Inclui também todas as outras formas de comunicação de uma organização. Nesta realidade holística, pode-se argumentar que a qualidade de uma frase traduzida individualmente é menos importante do que a qualidade da consistência e coerência em todo o texto traduzido no seu conjunto. Cada organização tem o seu próprio vocabulário distintivo: terminologia e expressões sobre produtos e funções, áreas de negócio, aspetos do serviço, conceitos estratégicos, entre outros. A coerência da tradução destes termos constitui um aspeto fundamental da qualidade da tradução. Se uma tradução no centro de ajuda não corresponder aos termos utilizados nos produtos ou nos botões, a qualidade da tradução é insatisfatória. Não importa se as traduções individuais estão tecnicamente corretas ou não. Quando uma plataforma de tradução baseada em IA determina a terminologia, o estilo e o tom em grande escala (como o DeepL faz com glossários, regras de estilo e memórias de tradução), torna-se consideravelmente mais valiosa. Em contrapartida, a natureza fundamentalmente probabilística dos grandes modelos de linguagem de uso geral (LLM), como o Claude, o Gemini e o ChatGPT, sacrifica o determinismo, a conformidade e a coerência. Estes perdem aquilo que realmente importa no que diz respeito à qualidade da tradução na prática. O que os testes de qualidade da tradução não têm em conta: como se alcança a qualidade Os testes de qualidade padrão de tradução também não se preocupam com a forma como o desempenho de qualidade é alcançado, nem com o quão escalável realmente é. Os próprios testes cegos da DeepL com peritos demonstram que os mais recentes LLM de uso geral, em definições de raciocínio avançado, podem produzir uma qualidade de tradução competitiva em combinações específicas de idiomas. No entanto, fazem-no utilizando modelos de maior dimensão, áreas de tarefa mais abrangentes e janelas de contexto mais amplas. Isto significa que utilizam muitos tokens (com custos imprevisíveis) e demoram muito mais tempo (pelo menos quatro vezes e até 29 vezes mais lentos), o que tem um grande impacto se estiver a implementar a tradução baseada em IA em produtos através de uma API. O mais importante em termos de qualidade é que são, por natureza, menos previsíveis nas traduções que escolhem. Essencialmente, reinventam a roda da tradução para cada tarefa, por isso, é muito menos provável que os termos e as expressões que utilizam num contexto se repitam noutro. Se gerir um processo de tradução numa escala empresarial, é esse o aspeto da qualidade a que deve prestar maior atenção. Os resultados dos testes de qualidade não revelam praticamente nada de útil sobre o assunto. Por que razão estamos a desenvolver uma visão holística da qualidade que coloca os clientes no controlo Por estas razões, as pontuações dos testes automatizados constituem um indicador muito limitado da qualidade da tradução. No entanto, tal não significa que não sejam uma ferramenta extremamente útil quando se trata de assumir o controlo da qualidade das traduções. Na verdade, são extremamente valiosas se definir o seu papel de forma diferente. Na DeepL, criámos um novo modelo de avaliação da qualidade da tradução (TQE) , que utiliza um modelo de IA desenvolvido especificamente para avaliar a qualidade das traduções da DeepL. O mais importante é que este modelo não se limita a atribuir uma "pontuação" à tradução e a passar à seguinte. O seu papel consiste em destacar potenciais erros e áreas de uma tradução que podem ser melhorados através da intervenção de peritos humanos. Reconhece que é este discernimento humano, em última instância, que conta. Quando o nosso modelo de avaliação da qualidade da tradução (TQE) analisa um texto, fá-lo tendo em conta todas as funções de personalização com que trabalha no DeepL. Não analisa a qualidade da tradução de forma isolada. Verifica como a terminologia, o estilo e o tom da sua organização são aplicados no contexto. Proporciona uma visão holística da qualidade que realmente importa na prática. Se se preocupa com a qualidade da tradução (e acredito que ainda o deva fazer), é esta a perspetiva que realmente importa. A questão não é os testes. É encontrar a perspetiva sobre a qualidade da tradução que se adequa a si e que funciona para o seu conteúdo na prática. Tem interesse em utilizar a TQE para avaliar a qualidade da tradução? Encontrará todos os detalhes e as opções para aderir ao nosso ambiente de testes da TQE em DeepL AI Labs .
📥 下载地址(文章结尾)
装机神器,一键装机,安装任何系统。纯净版,原版,软件版,精简版,英文版。