Ձեռնարկատիրական տվյալների ներկայիս միջավայրը բնորոշվում է մի հակասությամբ. կազմակերպությունները խեղդվում են տեղեկատվության առատությունից, սակայն զգում են դրա իմաստալից վերլուծության սուր պակաս։ Վերջին երկու տասնամյակների ընթացքում մենք թվայնացրել ենք գրեթե բոլոր ներքին աշխատանքային գործընթացները, ինչի արդյունքում առաջացել են պետաբայթերով կառուցվածք չունեցող տվյալներ, որոնք «փակված» են ստատիկ ձևաչափերում։ Ձեռնարկությունների մեծամասնության համար այս «գիտելիքը» գտնվում է հազարավոր PDF-ների, աղյուսակների և քաղաքականությունների փաստաթղթերի մի անկազմակերպ ու մասնատված գերեզմանոցում։

Retrieval-Augmented Generation (RAG)-ի (որոնման արդյունքներով հարստացված գեներացում) վերջին նվաճումները խոստանում էին լրացնել այս բացը, սակայն մենք փակուղու առաջ ենք կանգնում, երբ դուրս ենք գալիս պարզ, մեկուսացված հարցումների շրջանակից։ Երբ խնդիրը հարյուրավոր անկապ փաստաթղթեր պարունակող թղթապանակն է, ավանդական RAG ճարտարապետությունները հաճախ չեն կարողանում հաղթահարել խնդիրը՝ հաճախակի տալով անպետք «աղմուկ» կամ չկարողանալով համադրել տեղեկատվությունը տարբեր ֆայլերից։ Այն տեղաշարժը, որին մենք այսօր ականատես ենք լինում, տարբեր ֆայլերի պանակը որպես մեկուսացված կղզիների հավաքածու դիտարկելուց հրաժարվելն է և այն որպես միասնական, խորը կառուցվածքային ու ներդրված փաստաթուղթ ընկալելու անցումն է։

Ճարտարապետական շրջադարձ. վեկտորային նմանությունից այն կողմ

Ստանդարտ RAG խողովակաշարերը (pipelines) սովորաբար աշխատում են տեքստը հատվածների բաժանելով և օգտատիրոջ հարցումները դրանց հետ համեմատելով՝ հիմնվելով իմաստային (semantic) նմանության վրա։ Խոշոր ձեռնարկությունների միջավայրում այս մեթոդը չի դիմանում իր իսկ ծանրությանը։ Եթե ձեր ընկերությունը նույն պահոցում է պահում արտադրանքի ձեռնարկները, իրավական բացահայտումները և HR քաղաքականությունները, ապա «համապատասխանություն» (compliance) բառի վեկտորային որոնումը կարող է վերադարձնել մարքեթինգային բրոշյուրից մի անպետք պարբերություն միայն այն պատճառով, որ լեզվական նշանները պատահաբար համընկել են։

Տեխնիկական առաջնորդների շրջանում ի հայտ եկող լուծումը ինդեքսավորման հիերարխիկ մոտեցումն է։ Ամբողջ փաստաթղթային բազան «հարթեցնելու» փոխարեն՝ մենք ավելի ու ավելի ենք թղթապանակի կազմակերպումը դիտարկում որպես մետատվյալներով հարուստ ուղեցույց։ Յուրաքանչյուր ֆայլի համար ամփոփագիր ստանալով և այն փաստաթղթի բնօրինակ բովանդակության կամ կառուցվածքային հիերարխիայի հետ զուգակցելով՝ մենք ստեղծում ենք «երկաստիճան» որոնման համակարգ։

Այս մոդելում որոնման շարժիչը նախ հարցումն ուղղում է կոնկրետ փաստաթղթին (կամ փաստաթղթերի փոքր ենթախմբին), որը համատեքստային առումով համապատասխան է, և միայն դրանից հետո է դիտարկում ներքին բովանդակությունը։ Սա նման է փորձառու գրադարանավարի աշխատելաոճին. նրանք գրադարանի յուրաքանչյուր գիրք չեն կարդում հարցի պատասխանը գտնելու համար, այլ օգտվում են կատալոգից՝ ճիշտ գիրքը գտնելու, ցանկին նայելու և այնուհետև կոնկրետ էջը ստուգելու համար։

  • Իմաստային ուղղորդում (Semantic Routing). Մետատվյալների օգտագործումը «որոնման աղտոտումը» կանխելու համար, որտեղ անկապ փաստաթղթերը նվազեցնում են պատասխանի որակը։
  • Կառուցվածքային իրազեկում. Փաստաթղթի բնօրինակ կառուցվածքի (վերնագրեր, ենթաբաժիններ և գլուխներ) օգտագործումը՝ LLM-ին (լեզվական մեծ մոդելին) նախքան որոնումը տեղեկատվության հստակ «քարտեզ» տրամադրելու համար։
  • Թոքենների ծախսերի կրճատում. LLM-ի համատեքստային պատուհանին միայն համապատասխան ենթաբաժինները փոխանցելով՝ մենք զգալիորեն նվազեցնում ենք հաշվողական ծախսերը և նվազեցնում «հալյուցինացիաների» (ոչ ճշգրիտ պատասխանների) հավանականությունը։

Բիզնես համատեքստ և ROI. «Ctrl+F» աշխատաոճի վախճանը

Բիզնես ղեկավարների համար սա նշանակում է ձեռնարկությունում տեղեկատվության հասանելիության դրամատիկ փոփոխություն։ Ավանդական «գտնել և որոնել» աշխատաոճը, որը հաճախ պահանջում է, որ մարդը հստակ իմանա, թե որ ֆայլում է պատասխանը, դառնում է հնացած։ Երբ RAG-ը ներդրվում է հիերարխիկ, փաստաթղթերի նկատմամբ գիտակից կառուցվածքով, այն դառնում է թվային փոխակերպման հզոր գործիք։

Դիտարկենք ազդեցությունը այնպիսի պատասխանատու գործառույթների վրա, ինչպիսիք են գնումները կամ իրավական համապատասխանությունը։ Ժառանգված (legacy) միջավայրում գնումների պատասխանատուն կարող է ժամեր ծախսել՝ քսան տարբեր պայմանագրերից պայմաններ հավաքագրելու համար՝ մատակարարի պատասխանատվության մասին հարցին պատասխանելու նպատակով։ Հիերարխիկ RAG-ի դեպքում նույն աշխատակիցը փոխազդում է AI գործակալի հետ, որը կարող է վայրկյանների ընթացքում համադրել պատասխանը՝ քաղելով այն հենց բազմաթիվ փաստաթղթերի համապատասխան կետերից՝ պահպանելով բարձր ճշգրտություն։

ROI-ն (ներդրումների վերադարձը) այստեղ բազմակողմանի է.

  • Արտադրողականության բարձրացում. Փաստաթղթերի ձեռքով վերանայման ժամանակատար «որոնել և ստուգել» գործընթացի վերացում։
  • Որոշումների կայացման հետևողականություն. Ապահովում, որ բոլոր թիմերը՝ հաճախորդների սպասարկումից մինչև ճարտարագիտություն, հղում են կատարում նույն, արդիական փաստաթղթերին։
  • Մասշտաբայնություն. Ձեռնարկությունները կարող են հազարավոր նոր փաստաթղթեր ավելացնել իրենց գիտելիքների բազայում՝ առանց որոնողական համակարգի աշխատանքի վատթարացման, քանի որ համակարգը հիմնվում է կառուցվածքային ինդեքսավորման, այլ ոչ թե հում տեքստի գծային սկանավորման վրա։

Այնուամենայնիվ, դեպի այս բարդ RAG ճարտարապետություն շար