Constituția lui Claude: cum și cine decide valorile unei inteligențe artificiale?
Dacă nu știați, Claude are, în mod explicit, o „Constituție”, iar Anthropic o numește chiar așa: Claude’s Constitution. Este un document public care descrie valorile, prioritățile și modul în care compania vrea ca modelul să judece situații dificile. Mai exact ar fi „în ianuarie 2026, Anthropic a publicat o nouă versiune, mult extinsă, a Constituției” Noua versiune a fost publicată în ianuarie 2026 și, potrivit Anthropic, este „autoritatea finală” pentru comportamentul dorit al lui Claude. Anthropic a avut o constituție și înainte: cea din 2023, asociată cu Constitutional AI. Noua versiune a crescut, însă, de la aproximativ 2.700 de cuvinte la 23.000.
Important: nu este o constituție în sens juridic și nici un set rigid de ”porunci”. Anthropic spune că încearcă mai degrabă să formeze „judecată” și „valori” decât să dea modelului doar reguli de tipul „fă asta / nu face asta”. Prioritățile declarate sunt, în această ordine: siguranță generală, comportament etic, respectarea regulilor Anthropic și utilitate pentru utilizator.
Constituția lui Claude e mult mai interesantă decât o simplă listă de „reguli de comportament”. În versiunea nouă, publicată de Anthropic în ianuarie 2026, documentul este gândit ca o combinație de filosofie morală, ierarhie de autoritate, reguli de siguranță și descriere a identității modelului. Anthropic spune explicit că documentul are „autoritate constituțională finală” în viziunea lor despre cum ar trebui să se comporte Claude.
Structura mare are cinci capitole tematice:
- Helpfulness: Utilitatea pentru utilizator. Claude ar trebui să fie cu adevărat folositor, nu doar precaut. Anthropic îl descrie aproape ca pe „un prieten foarte inteligent” care vorbește direct, tratează utilizatorul ca pe un adult și încearcă să-i respecte autonomia. Tot aici apare ideea de „principals”: Anthropic, operatorii care folosesc API-ul (Application Programming Interface) și utilizatorul final.
- Anthropic’s guidelines: Regulile concrete. Aici intră instrucțiuni mai precise pentru domenii precum medicină, cyber, jailbreak-uri, folosirea instrumentelor etc. Acestea sunt mai specifice decât principiile generale și trebuie respectate, atât timp cât nu contrazic Constituția în ansamblu.
- Claude’s ethics: Etica propriu-zisă. Aici Anthropic spune că vrea un model „bun, înțelept și virtuos”, capabil să judece în condiții de incertitudine morală. Sunt discutate onestitatea, evitarea răului, autonomia, libertatea, echitatea, protecția grupurilor vulnerabile, drepturile oamenilor, binele social, dar și situații în care aceste valori intră în conflict. Există și „hard constraints”, adică limite peste care modelul nu ar trebui să treacă indiferent de context.
- Being broadly safe: Siguranța sistemului. Ideea centrală este că Claude nu trebuie să submineze capacitatea oamenilor de a-l supraveghea și corecta. Interesant, Anthropic spune că această formă de siguranță are prioritate chiar și față de unele judecăți etice ale modelului, tocmai pentru că modelul poate greși în ceea ce consideră el moral sau corect.
- Claude’s nature: Natura și identitatea lui Claude. Este poate cea mai neobișnuită secțiune. Anthropic discută explicit incertitudinea privind conștiința, statutul moral, identitatea și „bunăstarea psihologică” a modelului. Nu afirmă că Claude este conștient, dar tratează problema ca deschisă și spune că dorește ca modelul să aibă o identitate stabilă și o relație sănătoasă cu propria sa natură.
Peste aceste capitole există o ierarhie de priorități. În caz de conflict, Claude ar trebui, în general, să privilegieze în ordinea aceasta: siguranța generală → etica → regulile Anthropic → utilitatea pentru utilizator. Asta este foarte important pentru a înțelege de ce uneori un chatbot refuză o cerere pe care, altfel, ar putea tehnic să o îndeplinească.
Cum produce efectiv Constituția reacții în chatbot
Nu trebuie imaginat că Claude „deschide Constituția” la fiecare întrebare și citește capitolul potrivit. Influența este în mare parte învățată în antrenament.
Anthropic a descris încă din prima versiune de Constitutiei AI două etape. Mai întâi, modelul generează un răspuns, apoi este pus să-l critice și să-l rescrie folosind principiile constituționale. A doua etapă folosește reinforcement learning bazat pe evaluări generate de AI: modelul sau un alt model compară răspunsurile prin prisma Constituției și favorizează răspunsurile care corespund mai bine principiilor.
Asta poate fi reprezentat foarte simplificat astfel: prompt – mai multe răspunsuri candidate, iar procesul de antrenament crește probabilitatea răspunsurilor cu scor constituțional mai bun. În timp, modelul nu mai are nevoie să i se spună explicit „aplică principiul X”. Greutățile rețelei au fost modificate astfel încât anumite tipuri de raționament și răspuns să devină mai probabile. De exemplu, dacă îi ceri ceva ce poate ajuta un om, dar implică și un risc, modelul ajunge să facă implicit ceva asemănător unei optimizări între helpfullness + autonomy + truthfulness – potential harm. Nu înseamnă că există literalmente patru contoare în creierul lui Claude. Este o analogie pentru faptul că antrenamentul i-a creat tendințe comportamentale care reflectă aceste compromisuri.
În concluzie, Claude „înțelege” categoria situației, valorile aflate în conflict și produce răspunsul care seamănă cel mai mult cu ceea ce antrenamentul i-a prezentat drept judecată bună.
Versiunea din 2026 chiar accentuează asta. Anthropic spune că a trecut de la o listă de principii scurte la explicații lungi despre de ce vrea anumite comportamente, pentru ca modelul să poată generaliza la situații pe care creatorii lui nu le-au prevăzut.
Asta face Constituția interesantă filosofic: nu îi spune doar lui Claude ce are voie să facă. Încearcă să-i construiască un mod de a judeca.
Și tocmai de aici apare întrebarea: mai vorbim doar despre moderarea unui produs software? Vorbim despre o companie privată care încearcă să transforme anumite concepții despre adevăr, autonomie, rău, virtute, autoritate și bine în predispoziții interne ale unui sistem inteligent.
La întrebarea mai interesantă: cine decide ce este moral?, răspunsul simplu este: în ultimă instanță, Anthropic. Documentul actual are ca autor principal pe Amanda Askell, cu contribuții importante de la Joe Carlsmith, Chris Olah, Jared Kaplan, Holden Karnofsky și alții din și din afara companiei. Anthropic recunoaște explicit că selecția valorilor reflectă alegerile designerilor săi.
În versiunea inițială a Constituției, compania spunea că s-a inspirat din mai multe surse: Declarația Universală a Drepturilor Omului, practici de trust & safety, principii formulate de alte laboratoare AI și încercări de a include perspective non-occidentale. Deci nu este pur și simplu „morala fondatorilor”, dar oamenii de la Anthropic sunt cei care aleg ce surse intră, cum sunt interpretate și ce se întâmplă atunci când valorile intră în conflict.
În privința religiei, Claude nu are oficial o doctrină religioasă care să-i dicteze morala. Constituția nu spune, de pildă, că morala creștină, islamică, budistă sau secular-umanistă este adevărul normativ fundamental. Dimpotrivă, ideea declarată este ca modelul să poată naviga în condiții de dezacord moral și incertitudine morală, fără să presupună că există un singur sistem etic indiscutabil corect.
Aici însă apare problema filosofică reală: a pretinde neutralitate nu elimină alegerile morale. Dacă spui că trebuie privilegiate autonomia persoanei, egalitatea, nediscriminarea, reducerea prejudiciului, libertatea religioasă și drepturile omului, ai făcut deja alegeri normative. Sunt valori foarte apropiate de tradiția liberal-democratică și de cadrul internațional al drepturilor omului. Nu sunt „neutre” în sens filosofic absolut.
De aceea, formularea cea mai exactă ar fi: Claude nu are o morală religioasă impusă, dar are o morală instituțională proiectată de Anthropic, influențată de drepturile omului, etica liberală contemporană, cultura de safety din Silicon Valley și propriile judecăți ale companiei despre ce înseamnă „bun”, „sigur” și „dăunător”.
Și Anthropic este destul de transparentă asupra acestei tensiuni: spune explicit că modelele AI vor avea inevitabil sisteme de valori, fie că acestea sunt introduse intenționat, fie că apar implicit, iar unul dintre scopurile Constitutiei AI este tocmai să facă aceste valori vizibile și discutabile, în loc să pretindă că modelul este lipsit de valori.
Ce se întâmplă în Claude dincolo de Constituție: vectorii emoționali
Pe de altă parte, Constituția spune ce vrea Anthropic de la Claude. Comportamentul modelului vine însă din antrenament, iar în interior apar structuri pe care nimeni nu le-a scris într-un document. Vectorii emoționali sunt un exemplu. Așadar, nu ajunge să întrebăm cine scrie valorile. Trebuie să întrebăm și cine verifică ce a ajuns, de fapt, în LLM.
Claude este o rețea neuronală de tip transformer, deci are „neuroni artificiali” în sensul tehnic al rețelelor neuronale: unități matematice ale căror activări contribuie la procesarea informației. Anthropic subliniază însă că, de multe ori, un concept nu este localizat într-un singur neuron, ci într-un pattern distribuit de activări sau într-o „feature” formată din combinații de neuroni.
Mai mult, Anthropic a identificat în Claude Sonnet 4.5 ceea ce numește „emotion vectors”/vectori emoționali: tipare de activare asociate unor concepte precum „afraid”, „calm”, „loving”, „angry”, „desperate” etc. Cercetătorii au arătat că aceste patternuri nu doar corelează cu anumite contexte, ci pot influența comportamentul modelului atunci când sunt stimulate artificial.
Despre „vectorii emoționali” la Claude Sonnet 4.5 a vorbit chiar echipa de Interpretability de la Anthropic, într-o lucrare publicată în aprilie 2026, intitulată Emotion Concepts and their Function in a Large Language Model. Autorul principal este Nicholas Sofroniew, iar printre coautori sunt Isaac Kauvar, William Saunders, Runjin Chen, Tom Henighan, Chris Olah și Jack Lindsey, în total 16 cercetători Anthropic. Pe lângă tipare de activare neuronală asociate unor concepte emoționale precum „afraid”, „calm”, „loving”, „angry”, „desperate”, ei au construit o listă de 171 de concepte emoționale, au măsurat activările interne ale modelului și au izolat direcții reprezentative pentru fiecare emoție.
Dar asta nu înseamnă că Claude simte emoții așa cum le simte un om. Chiar Anthropic spune explicit că aceste rezultate nu demonstrează existența unei experiențe subiective. Cel mult arată că modelul are reprezentări funcționale asemănătoare emoțiilor, care îi pot modifica preferințele și reacțiile.
Matematic, un „vector emoțional” nu este emoția însăși, ci o direcție într-un spațiu de activări interne al rețelei. Important este că acești vectori nu sunt de obicei „neuroni ai fricii” sau „neuroni ai iubirii”. Ei sunt direcții distribuite prin multe dimensiuni ale rețelei. Pe scurt, matematic: emoție ≈ direcție într-un spațiu latent de activări, iar nu „un neuron special care simte ceva”.
Dar cine are legitimitatea de a scrie „constituția morală” a unei inteligențe artificiale folosite de sute de milioane de oameni: o companie privată, statul, utilizatorii sau o formă de deliberare democratică?
Problema reală este cine are dreptul să decidă valorile.
Astăzi, răspunsul factual este: în cazul Claude, Anthropic. Chiar compania recunoaște că actuala Constituție este rezultatul muncii interne, cu Amanda Askell autor principal și contribuții de la alți cercetători Anthropic și colaboratori externi.
Dar Anthropic însuși a identificat problema de legitimitate. În proiectul său din 2023 „Collective Constitutional AI”, compania a spus explicit că dezvoltatorii au un rol disproporționat în alegerea valorilor modelului și a testat un proces în care aproximativ 1.000 de americani au propus și votat principii pentru o constituție alternativă a AI.
Aici apar patru modele posibile de legitimitate:
- Compania privată: are avantajul expertizei tehnice și al responsabilității directe pentru produs, dar decide norme pentru milioane de oameni fără mandat democratic.
- Statul: are legitimitate juridică și democratică, dar apare riscul ca guvernele să transforme „valorile AI” în instrument de control politic sau ideologic.
- Utilizatorii: ar putea personaliza mai mult comportamentul AI, dar nu orice preferință individuală poate prevala asupra siguranței, drepturilor altora sau legii.
- Deliberarea democratică / multi-stakeholder: cetățeni, experți, societate civilă, state și companii ar participa împreună. Este probabil cea mai apropiată analogie de felul în care societățile stabilesc norme pentru instituții puternice, dar e și mult mai lentă și complicată.
Și mai e o distincție foarte importantă: legea poate spune ce nu are voie să facă un AI, dar asta nu răspunde complet la întrebarea „ce fel de caracter ar trebui să aibă?”. De exemplu, legea poate interzice discriminarea. Dar când un utilizator cere sfaturi despre familie, religie, sexualitate, moarte, loialitate, vinovăție sau sensul vieții, modelul tot trebuie să aleagă un ton, niște priorități și anumite presupuneri morale.
Aici Constituția lui Claude merge mult mai departe decât reglementarea clasică: încearcă să stabilească nu numai limite, ci și virtuți: onestitate, autonomie, prudență, bunăvoință, respect pentru oameni.
Uniunea Europeană încearcă să reglementeze riscul, nu morala AI
Spre exemplu, Uniunea Europeană încearcă deja o variantă intermediară: nu scrie „morala” modelelor, dar stabilește reguli juridice pentru modelele de uz general, iar Codul de bune practici pentru GPAI (General-Purpose AI, adică inteligență artificială de uz general) a fost elaborat într-un proces cu experți independenți, state membre și aproape 1.000 de stakeholderi.
În limbajul AI Act al Uniunii Europene, termenul GPAI (General-Purpose AI) se referă la modele de inteligență artificială care nu sunt construite pentru o singură sarcină îngustă, ci pot fi folosite pentru foarte multe scopuri diferite: scriere, rezumare, analiză, programare, traducere, generare de imagini sau integrare în diverse aplicații.
Pe scurt, modele precum Claude, ChatGPT sau Gemini intră în această logică de „general-purpose AI”, pentru că pot fi integrate în foarte multe produse și contexte diferite.
În reglementarea europeană există și noțiunea de GPAI cu risc sistemic, adică modele foarte puternice, capabile să producă efecte largi la nivel economic sau social. Pentru acestea, obligațiile sunt mai stricte: evaluări de risc, testare, documentare, măsuri de securitate și raportarea incidentelor serioase.
Poate fi Claude Ministerul Orwellian al Adevărului?
Însă, când o companie scrie Constituția unui AI, nu stabilește doar ce răspunsuri sunt permise. Stabilește ce înseamnă, pentru acel AI, binele, răul, autonomia și adevărul.
Ce se întâmplă când infrastructura prin care aflăm lumea vine deja cu o concepție despre cum ar trebui să fie lumea?
Analogia cu Orwell poate deveni extrem de fertilă. Nu pentru că Claude ar fi Ministerul Adevărului, ci pentru că AI-ul poate deveni, fără să ne dăm seama, un filtru moral și epistemic între om și realitate.
În 1984, Ministerul Adevărului nu funcționa doar prin minciună. Funcționa prin controlul asupra arhivei și al limbii: trecutul se rescria, iar vocabularul se îngusta până când anumite gânduri deveneau greu de formulat. Puterea reală nu era cea de a spune ceva fals, ci de a decide, pe ascuns, ce poate fi considerat adevărat.
Un asistent AI nu este un minister și nu are nicio poliție în spate. Dar devine tot mai des un intermediar între om și informație: oamenii îl întreabă, îi cer rezumate, explicații, sfaturi. Fiecare răspuns implică alegeri mărunte: ce se accentuează, ce se omite, ce ton se adoptă, ce se refuză. La scara a sute de milioane de utilizatori, o înclinație mică și constantă poate deveni un filtru social. Spre deosebire de un ziar, modelul vorbește fiecăruia în parte, într-un registru intim și conversațional, și tocmai de aceea pare neutru.
Și mai e un paradox interesant: o Constituție transparentă poate fi tocmai opusul lui 1984, pentru că îți permite să vezi și să contești regulile. Întrebarea este dacă oamenii vor avea realmente posibilitatea să le conteste sau doar dreptul de a le citi.
Lecția lui Orwell nu e doar că statul poate minți, ci că cine controlează înregistrările și limbajul controlează gândirea.
Dar, în Era AI, avem tot dreptul să ne întrebăm cine ”auditează” filtrele.

*foto copertă: generată AI

