Vai al contenuto principale
Ultimo aggiornamento: 14 min di letturaBlog Italtrust
← Tutti gli articoli
Incontro di lavoro con tecnologia di traduzione
Blog Italtrust · Tecnologia e processo

CAT tool e memoria di traduzione: come funzionano

Segmentazione, corrispondenze, glossari e controlli automatici: che cosa cambia davvero quando si traduce la revisione 7 di un manuale già tradotto alla revisione 6.

Coworkers collaborating

Che cos'è un CAT tool e che cosa non è

Un CAT toolcomputer-assisted translation, in italiano strumento di traduzione assistita — è l'ambiente in cui un traduttore professionista lavora su un testo tecnico. Non traduce al posto suo: scompone il documento in unità di testo, mostra al traduttore ciò che è già stato tradotto in passato per lo stesso cliente, applica il glossario aziendale e verifica automaticamente una serie di errori formali prima della consegna.

La distinzione con la traduzione automatica è netta e conviene fissarla subito, perché nelle richieste di offerta le due cose vengono confuse di continuo. La traduzione automatica genera un testo nuovo a partire da un modello statistico o neurale. Il CAT tool, invece, è un'infrastruttura di lavoro: conserva, riutilizza e controlla. I due strumenti possono coesistere — un motore di traduzione automatica può essere collegato all'ambiente CAT e il risultato sottoposto a revisione umana secondo la norma ISO 18587 — ma restano cose diverse, con implicazioni diverse su qualità, riservatezza e prezzo. Il confronto è approfondito nell'articolo su traduzione automatica e traduzione umana.

Per un fabbricante di macchine il valore del CAT tool non è astratto. Si misura la prima volta che si aggiorna un manuale: quando la revisione 7 differisce dalla revisione 6 per due capitoli su dieci, l'unica domanda sensata è se si stia pagando la traduzione dell'intero manuale o soltanto delle parti cambiate.

Come funziona una memoria di traduzione

La memoria di traduzione (TM, translation memory) è un archivio bilingue di unità di testo già tradotte e approvate. Il funzionamento si articola in tre passaggi.

Segmentazione. Il documento di partenza viene suddiviso in segmenti, tipicamente frasi, secondo regole di segmentazione. Ogni segmento tradotto viene salvato in coppia con il testo di partenza.

Ricerca delle corrispondenze. Quando il traduttore apre un nuovo segmento, il sistema interroga la memoria e propone le corrispondenze trovate, classificate per grado di somiglianza: corrispondenza integrale quando il testo coincide, corrispondenza parziale quando differisce per una parte. Il sistema evidenzia le differenze, così che il traduttore intervenga solo su quelle.

Aggiornamento. Ogni segmento confermato torna in memoria e diventa disponibile per i progetti successivi.

Da qui deriva la voce che compare nei preventivi come analisi o conteggio ponderato: prima di iniziare, il sistema confronta il nuovo documento con la memoria esistente e produce un rapporto che distingue le ripetizioni interne, le corrispondenze integrali, quelle parziali suddivise per fasce e i segmenti nuovi. Il prezzo si costruisce su quel rapporto: le parti già tradotte e non modificate non vengono ritradotte, quelle parzialmente modificate richiedono un intervento ridotto, quelle nuove il lavoro pieno. È il motivo per cui la memoria, dopo qualche commessa, produce effetti visibili sul budget della documentazione — un tema ripreso nell'articolo sul costo di una traduzione professionale. Le fasce di sconto applicate a ripetizioni e corrispondenze di memoria sono pubblicate nel listino dei prezzi a cartella.

Software di memoria di traduzione

Perché conta sulle revisioni di manuale

Il caso tipico è quello di un costruttore di macchine per il confezionamento che vende la stessa piattaforma in dodici configurazioni. Il manuale d'uso e manutenzione condivide l'80 per cento del contenuto fra una configurazione e l'altra: avvertenze di sicurezza, procedure di messa in servizio, manutenzione ordinaria, tabelle dei ricambi. Cambiano il gruppo di alimentazione, alcune sequenze di regolazione e i dati tecnici.

Senza memoria di traduzione, ogni configurazione è un progetto a sé: si ritraduce tutto, si pagano di nuovo le stesse pagine e — soprattutto — si ottengono dodici versioni leggermente diverse delle stesse avvertenze. È il problema più serio, e non è di costo: è di conformità. Se la stessa avvertenza di sicurezza compare in tre formulazioni diverse in tre manuali della stessa famiglia, l'uniformità della documentazione tecnica viene meno, e in caso di contestazione la difesa del fabbricante si complica.

Con la memoria, invece, la parte comune resta identica per costruzione. La revisione successiva tocca solo il delta, i tempi di consegna si accorciano perché il volume effettivo è minore, e la terminologia della macchina resta stabile lungo tutta la vita del prodotto, dai primi manuali fino ai cataloghi ricambi e alle schede tecniche.

Lo stesso ragionamento vale per le schede di sicurezza di un'azienda chimica, dove le frasi di pericolo e di prudenza sono formulazioni fisse regolamentate, e per i fascicoli tecnici di un fabbricante di dispositivi medici, dove la coerenza fra versioni successive dell'istruzione per l'uso è parte del sistema qualità.

Coworkers collaborating

Glossario e term base: la terminologia della macchina

La memoria lavora sulla frase, il glossario lavora sul termine. Sono strumenti complementari e servono a scopi diversi.

Ogni azienda ha un vocabolario proprio, che convive con quello normativo. Un gruppo può chiamarsi carrello portapinza in un disegno, gruppo di presa in un manuale e pinza nell'interfaccia della macchina: se le tre denominazioni finiscono tradotte in tre modi diversi, il tecnico del cliente estero non capisce quale ricambio ordinare. Un glossario bilingue o multilingue fissa la denominazione approvata per ogni concetto, con l'eventuale definizione, il contesto d'uso e le forme da non usare.

La costruzione del glossario è un lavoro che conviene fare una volta sola e bene. Le fonti sono già in azienda: distinte base, disegni, schemi elettrici, listini ricambi, stringhe dell'interfaccia operatore, manuali già tradotti e giudicati validi. A queste si aggiungono i termini normalizzati: la terminologia della Direttiva Macchine, quella delle norme di prodotto applicabili, le denominazioni dei componenti secondo le norme di settore.

L'approvazione, però, non può restare al fornitore linguistico. La convalida dei termini chiave da parte dell'ufficio tecnico o del distributore locale è il passaggio che rende il glossario affidabile: chi vende in Germania sa se il cliente finale usa un termine o un altro, il traduttore no. Una revisione terminologica annuale, concentrata sui termini nuovi introdotti dai prodotti dell'anno, è sufficiente a mantenerlo aggiornato.

Formati e standard: XLIFF, TMX, TBX, SRX

Gli strumenti CAT si appoggiano a formati aperti che rendono i dati trasferibili da un ambiente all'altro. Conoscerne quattro basta per porre le domande giuste a un fornitore.

  • XLIFF (XML Localization Interchange File Format), standard OASIS, è il formato di scambio dei file in lavorazione: contiene i segmenti di partenza, quelli di arrivo, lo stato di ciascun segmento e i riferimenti alla formattazione.
  • TMX (Translation Memory eXchange) è il formato di scambio delle memorie di traduzione. È ciò che va chiesto quando si vuole portare via il proprio patrimonio linguistico.
  • TBX (TermBase eXchange), normalizzato come ISO 30042, è il formato di scambio dei glossari terminologici.
  • SRX (Segmentation Rules eXchange) descrive le regole di segmentazione, cioè il criterio con cui il testo viene diviso in unità. Regole diverse producono memorie non allineate fra loro: è un dettaglio tecnico che diventa rilevante quando si cambia fornitore.

La domanda operativa da porre in fase di qualifica è semplice: al termine del rapporto, ricevo memorie in TMX e glossari in TBX? Una risposta affermativa e messa per iscritto vale più di qualsiasi dichiarazione sulla tecnologia usata.

I formati dell'ufficio tecnico

Un ambiente CAT professionale non lavora su testo copiato e incollato: apre il formato nativo, protegge tutto ciò che non è testo traducibile e restituisce un file impaginato. Questo è il punto in cui molte forniture si complicano.

I formati che arrivano più spesso da un ufficio tecnico italiano sono InDesign (con lo scambio in .idml), FrameMaker, Word strutturato con stili, XML e in particolare DITA per la documentazione modulare, AutoCAD per i disegni con testi da tradurre, tabelle Excel per distinte e listini ricambi, e i file di stringhe dell'interfaccia operatore, che a seconda del sistema possono essere .po, .resx, .json, .xml o tabelle esportate dal software di sviluppo dell'HMI.

Ogni formato porta un problema suo. Nell'impaginato, il testo tradotto cambia lunghezza: il tedesco si allunga rispetto all'italiano, il cinese si accorcia, l'arabo impone la scrittura da destra a sinistra e il rifacimento del layout. Nel disegno, il testo è dentro blocchi con spazio fisso. Nelle stringhe dell'interfaccia esistono limiti di caratteri imposti dal display e segnaposto variabili che non devono essere toccati. Per questo la fase di impaginazione dopo la traduzione — il desktop publishing multilingue — è una lavorazione a sé, da prevedere nel preventivo e nei tempi.

Il caso peggiore resta il PDF senza file sorgente. Un PDF va convertito o ricostruito, e la ricostruzione costa più della traduzione. Se il documento ha una storia — cioè verrà aggiornato — conviene sempre recuperare il sorgente prima di iniziare.

Coworkers collaborating

I controlli automatici di qualità

Prima della consegna, l'ambiente CAT esegue una serie di verifiche che l'occhio umano fatica a garantire su centinaia di pagine:

  • Numeri e unità di misura: valori che compaiono nel testo di partenza e non in quello di arrivo, o alterati.
  • Tag e formattazione: elementi di marcatura mancanti o fuori posto, che romperebbero l'impaginato.
  • Coerenza terminologica: termini tradotti in modo difforme dal glossario approvato, o termini vietati.
  • Segmenti non tradotti o identici al testo di partenza.
  • Coerenza interna: la stessa frase di partenza tradotta in due modi diversi nello stesso documento.
  • Doppi spazi, punteggiatura, virgolette secondo le convenzioni della lingua di arrivo.

Questi controlli non sostituiscono la revisione umana prevista dalla ISO 17100, che richiede che la traduzione sia riletta da una seconda persona con competenze adeguate — il tema è trattato nell'articolo dedicato alla norma ISO 17100. Eliminano però la categoria di errori più insidiosa nella documentazione tecnica: quella formale. Una coppia di serraggio con la virgola spostata o una tensione di alimentazione riportata male non è un errore di stile.

Chi possiede la memoria di traduzione

È la clausola contrattuale che le aziende dimenticano più spesso, e quella che pesa di più nel medio periodo.

La memoria di traduzione è costruita a partire dai documenti del cliente e pagata dal cliente attraverso le commesse. È ragionevole, quindi, che ne resti titolare. Se il contratto tace, però, la memoria resta nell'ambiente del fornitore, e il giorno in cui l'azienda valuta un cambio di fornitore scopre che ripartire senza memoria significa perdere lo sconto sulle ripetizioni e la coerenza costruita in anni di manuali.

Le clausole da inserire sono tre, brevi:

  1. Titolarità: memorie, glossari e file di lavorazione relativi ai contenuti del cliente sono di proprietà del cliente.
  2. Consegna su richiesta: il fornitore consegna, entro un termine definito, le memorie in TMX e i glossari in TBX, senza costi aggiuntivi.
  3. Riservatezza e uso limitato: i contenuti non possono essere usati per altri clienti né per l'addestramento di modelli, salvo autorizzazione scritta.

Le stesse clausole, insieme alla griglia di analisi e alle domande da porre al fornitore prima di firmare, sono raccolte nella guida pratica all'acquisto di CAT tool e memoria di traduzione.

Quest'ultimo punto si collega direttamente agli obblighi in materia di protezione dei dati e di tutela del segreto industriale, trattati nell'articolo su GDPR e traduzione.

Come preparare i file per sfruttare la memoria

Il rendimento della memoria dipende in buona parte da come è scritto e gestito il documento di partenza. Alcune abitudini dell'ufficio tecnico fanno la differenza:

  • Scrivere in modo coerente. Se la stessa avvertenza viene riscritta ogni volta con parole diverse, la memoria non trova corrispondenze e il vantaggio svanisce. Uno stile di scrittura tecnica controllato — frasi brevi, struttura ripetibile, terminologia fissa — aumenta il tasso di riutilizzo.
  • Non spezzare le frasi con interruzioni di riga manuali. Le interruzioni inserite per ragioni grafiche frammentano i segmenti e rendono le corrispondenze inutilizzabili.
  • Non inserire testo dentro le immagini. Le didascalie in un'immagine non sono traducibili senza rifare l'immagine. Meglio testo sovrapposto o richiami numerici con legenda.
  • Consegnare il sorgente, non il PDF.
  • Segnalare le parti modificate. Un elenco delle sezioni cambiate rispetto alla revisione precedente consente al fornitore di verificare l'analisi e di individuare eventuali anomalie.
  • Congelare il testo prima di iniziare. Le modifiche in corso d'opera sono la principale causa di ritardi e di disallineamenti fra lingue.

Chi produce documentazione in modo continuativo trova conveniente concentrare le lavorazioni: tradurre insieme le revisioni di più manuali permette di sfruttare le ripetizioni fra documenti diversi, che nel conteggio a documento singolo andrebbero perse. La logica di gestione è quella descritta nella pagina sulla traduzione tecnica.

Coworkers collaborating

Traduzione automatica dentro l'ambiente CAT

L'integrazione fra memoria, glossario e traduzione automatica è oggi la configurazione più diffusa per i volumi elevati. Il funzionamento è a cascata: se la memoria contiene una corrispondenza utile, si usa quella; se non la contiene, il segmento può essere proposto da un motore automatico e sottoposto a post-editing da parte di un traduttore professionista, secondo i requisiti della ISO 18587.

Tre avvertenze, però, valgono per la documentazione industriale.

La prima riguarda la riservatezza: i contenuti inviati a un motore pubblico escono dal perimetro aziendale. Per disegni, procedure e documentazione di prodotto non ancora immessa sul mercato, questa è una decisione che va presa consapevolmente e regolata per contratto, non lasciata all'iniziativa del singolo traduttore.

La seconda riguarda la terminologia: un motore generico non conosce il vocabolario della macchina e tende a variare, che è esattamente ciò che la documentazione tecnica non tollera. L'uso di motori addestrati sui dati del cliente o vincolati al glossario riduce il problema ma non lo elimina.

La terza riguarda il tipo di documento. Su un catalogo ricambi il vantaggio è concreto; su un'avvertenza di sicurezza, su una dichiarazione di conformità o su un testo destinato a un ente regolatore, il margine di rischio non è compensato dal risparmio. Il criterio di scelta è descritto nella pagina sul post-editing.

Che cosa chiedere a un fornitore sulla gestione linguistica

01

Titolarità dei dati

Memorie e glossari restano di proprietà del cliente e vengono consegnati su richiesta in TMX e TBX.

02

Analisi preventiva

Il preventivo mostra il conteggio ponderato: ripetizioni, corrispondenze integrali, parziali e segmenti nuovi.

03

Formati nativi

Il fornitore lavora su .idml, XML, DITA, file di stringhe HMI e restituisce il file impaginato.

04

Gestione terminologica

Esiste un glossario approvato dall'ufficio tecnico e un percorso di aggiornamento periodico.

05

Controlli automatici

Numeri, unità di misura, tag e coerenza terminologica sono verificati prima della consegna.

06

Uso della traduzione automatica

Le condizioni d'uso dei motori automatici e il trattamento dei contenuti sono definiti per iscritto.

Domande frequenti sui CAT tool

Il CAT tool è l'ambiente in cui lavora un traduttore umano: segmenta il testo, recupera le traduzioni già approvate, applica il glossario ed esegue controlli formali. La traduzione automatica genera invece un testo nuovo tramite un modello. I due strumenti possono essere combinati, con revisione umana secondo la norma ISO 18587, ma non sono la stessa cosa.

Manuali che si aggiornano a ogni revisione?

Analizziamo i documenti esistenti, recuperiamo le traduzioni già pagate in memoria e impostiamo il glossario della macchina.

Richiedi un preventivo

Ottieni il Tuo Preventivo Gratuito

Inglese

Trascina qui il documento oppure clicca per selezionarlo

Analisi MateCat: usi con Filtex + MyMemory pubblica prima del calcolo prezzi.