Novi okvir koristi knowledge graph da meri koliko LLM zaista prati kontekst

Istraživači predlažu S3KG, kombinovanu strukturno-semantičku meru za poređenje znanja iz konteksta i odgovora modela, uz dijagnostiku grešaka na nivou pojedinačnih tripleta.

Više od površinske sličnosti teksta

Rad definiše kontekstualno razumevanje kao sposobnost modela da iz datog konteksta izdvoji relevantne informacije, integriše ih i izvede odgovor koji ostaje činjenično usklađen sa tim kontekstom.

Autori ukazuju da metrike poput BLEU-a i perplexity-ja uglavnom mere površinske karakteristike i ne rešavaju pitanje da li je odgovor stvarno kontekstualno zasnovan.

S3KG spaja strukturu i semantiku

Centralni deo predloga je Semantic Structural Similarity for Knowledge Graphs, odnosno S3KG, koji kombinuje strukturne i semantičke signale u jedan skor.

Dodatni dijagnostički okvir kategorizuje reasoning greške na nivou tripleta kako bi se tačnije videlo gde model gubi vezu sa kontekstom.

Autori navode da je kroz devet benchmarka S3KG ostvario F1 poboljšanja do 7,6 poena i AUROC do 0,973.

Izvori

Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.