അഞ്ച് ക്ലൗഡ് ഡ്രൈവുകളിലും 2021-ലെ ഒരു Slack ത്രെഡിലും Final_Final_v9_REAL_THIS_TIME.xlsx എന്ന പേരുള്ള ഒരു സ്പ്രെഡ്ഷീറ്റ് കണ്ടെത്താൻ ശ്രമിച്ചിട്ടുണ്ടോ? അതാണ് ആധുനിക ഡാറ്റാ ഡിസ്കവറി: എസ്കേപ്പ് റൂം, പക്ഷേ കൂടുതൽ ഡാഷ്ബോർഡുകളും കുറഞ്ഞ സൂചനകളുമുണ്ട്. DataHub-ലേക്ക് പ്രവേശിക്കുക, നിങ്ങളുടെ ഡാറ്റാ GPS ആകാൻ സാധ്യതയുള്ള ഓപ്പൺ സോഴ്സ് ഡാറ്റാ കാറ്റലോഗ്. ഈ അവലോകനത്തിൽ, ഞാൻ അത് പരീക്ഷിച്ചു, വഴിതെറ്റി, എന്റെ വഴി കണ്ടെത്തി - മെറ്റാഡാറ്റ ലിനേജ് ഗ്രാഫുകൾക്കും സ്കീമ സ്പെലങ്കിംഗിനുമിടയിൽ എവിടെയോ, ചിട്ടയായ ഡാറ്റ ആളുകളെ എന്തിനാണ് വിവേകരഹിതമായി സന്തോഷിപ്പിക്കുന്നതെന്ന് ഓർത്തു.
നമുക്ക് ഇതിനെക്കുറിച്ച് വിശദമായി ചർച്ച ചെയ്യാം, Joanna-യുടെ ശൈലിയിൽ: DataHub എന്താണ്, ഇത് ആർക്കുവേണ്ടിയുള്ളതാണ്, ഇത് എങ്ങനെ പ്രവർത്തിക്കുന്നു, എവിടെയാണ് തടസ്സങ്ങൾ ഉണ്ടാകുന്നത്, മറ്റാരെങ്കിലും ഒരു പുതിയ “സത്യത്തിന്റെ ഏക ഉറവിടം” ഡോക് ആരംഭിക്കുന്നതിന് മുമ്പ് നിങ്ങളുടെ ടീം ഇത് സ്വീകരിക്കണോ എന്ന് നോക്കാം. (Spoiler: ഒരെണ്ണം മാത്രമല്ല ഉണ്ടാകാറുള്ളു.)
DataHub ശരിക്കും എന്താണ്? നിങ്ങൾക്ക് ഉപയോഗിക്കാൻ കഴിയുന്ന ഒരു അവലോകനം
DataHub ഒരു ഓപ്പൺ സോഴ്സ് മെറ്റാഡാറ്റ പ്ലാറ്റ്ഫോമാണ് - നിങ്ങളുടെ ഡാറ്റാ ആസ്തികളുടെ ഒരു ജീവനുള്ള മാപ്പായി ഇതിനെ കരുതുക. ഇത് നിങ്ങളുടെ വെയർഹൗസുകൾ, ലേക്കുകൾ, BI ടൂളുകൾ, പൈപ്പ്ലൈനുകൾ എന്നിവ ക്രാൾ ചെയ്യുന്നു, തുടർന്ന് ആ കുഴപ്പത്തെ ഉടമസ്ഥാവകാശം, ഉപയോഗം, വംശപരമ്പര, ഡോക്യുമെന്റേഷൻ എന്നിവയെല്ലാം ഒരിടത്ത് നൽകുന്ന, തിരയാനും ബ്രൗസ് ചെയ്യാനും കഴിയുന്ന കാറ്റലോഗായി മാറ്റുന്നു. നിങ്ങളുടെ ഇപ്പോഴത്തെ ഡാറ്റാ കണ്ടെത്തൽ രീതി “ആ പട്ടിക എവിടെയാണ്?” എന്ന ചോദ്യത്തിന് ശേഷം പന്ത്രണ്ട് Slack പിംഗുകൾ അയക്കുന്നതാണെങ്കിൽ, DataHub ഒരു മുതിർന്നവരുടെ രീതിയാണ്.
- Core ആശയം: മെറ്റാഡാറ്റയെ ഏകീകരിക്കുക—സ്കീമകൾ, വംശപരമ്പര, ഉടമസ്ഥാവകാശം, ഡോക്യുമെന്റേഷൻ, ടാഗുകൾ—അങ്ങനെ ആളുകൾക്ക് ഡാറ്റ കണ്ടെത്താനും വിശ്വസിക്കാനും കഴിയും.
- ഓപ്പൺ സോഴ്സ് വേരുകൾ: LinkedIn-ൽ ജനിച്ച്, ഇപ്പോൾ സജീവമായ കമ്മ്യൂണിറ്റിയും എന്റർപ്രൈസ് ആഡ്-ഓണുകളും ഉണ്ട്.
- യഥാർത്ഥ ലോകത്തിലെ നേട്ടം: വേഗത്തിലുള്ള കണ്ടെത്തൽ, കുറഞ്ഞ ഡ്യൂപ്ലിക്കേറ്റ് ഡാഷ്ബോർഡുകൾ, കുറഞ്ഞ “ഈ പട്ടിക കാലഹരണപ്പെട്ടതാണോ?” സ്റ്റാൻഡ്-അപ്പുകൾ.
കഥ: ഞാൻ ഒരു KPI തിരഞ്ഞ് പോയപ്പോൾ ഒരു ഓർഗ് ചാർട്ട് കണ്ടെത്തി
ഒരു പുതിയ ജീവനക്കാരനെപ്പോലെ രാവിലെ 9:15-ന് ഒരു VP-യെ ആകർഷിക്കാൻ തീരുമാനിച്ചുറച്ച് ഞാൻ DataHub പരീക്ഷിച്ചു. ഞാൻ “active users” എന്ന് തിരഞ്ഞു, analytics.active_users_daily എന്ന് പേരുള്ള ഒരു പട്ടികയിൽ ക്ലിക്ക് ചെയ്തു, അതാ വരുന്നു: വിവരണങ്ങൾ, ഉടമസ്ഥർ, താഴേക്കുള്ള ഡാഷ്ബോർഡുകൾ, കഫീൻ കുടിച്ച് ഒരു സിവിൽ എഞ്ചിനീയർ പ്ലോട്ട് ചെയ്ത ഒരു മെട്രോ മാപ്പ് പോലെ തോന്നിക്കുന്ന ഒരു വംശാവലി ഗ്രാഫ്. ഞാൻ രൂപാന്തരീകരണ ജോലിയുടെ മുകളിലുള്ള ഭാഗത്തേക്ക് പോയി, അത് ആരാണ് നിർമ്മിച്ചതെന്ന് കണ്ടു, അത് അവസാനമായി എപ്പോൾ പ്രവർത്തിപ്പിച്ചു, കഴിഞ്ഞ ചൊവ്വാഴ്ച സംഖ്യകൾ എന്തുകൊണ്ട് മാറിയെന്നും മനസ്സിലാക്കി. ഞാൻ ആരെയും പിംഗ് ചെയ്തില്ല. README_please.md എന്ന് പേരുള്ള ഒരു ഡോക്യുമെന്റ് തുറന്നില്ല. വായനക്കാരേ, ഞാൻ ശാന്തനായിരുന്നു…
DataHub അവലോകനം: പ്രധാനപ്പെട്ട പ്രധാന സവിശേഷതകൾ
1) നിങ്ങളെ കരയിക്കാത്ത തിരയൽ
DataHub-ൻ്റെ തിരയൽ വേഗതയുള്ളതും ആശ്ചര്യകരമാംവിധം തെറ്റുകൾ പൊറുക്കുന്നതുമാണ്. Query synonyms? സഹായകരമാണ്. പ്ലാറ്റ്ഫോം, ഡൊമെയ്ൻ, ടാഗുകൾ, ഉടമസ്ഥർ എന്നിവയ്ക്കായുള്ള Facets? വളരെ സഹായകരമാണ്. ഇത് പട്ടികകൾ, ഡാഷ്ബോർഡുകൾ, പൈപ്പ്ലൈനുകൾ, ML ഫീച്ചറുകൾ, ഗ്ലോസറി ടേംസ് എന്നിവയെ ഫസ്റ്റ് ക്ലാസ് പൗരന്മാരെപ്പോലെ പരിഗണിക്കുന്നു. വിവരണം: ഡാറ്റാ whack‑a‑mole കളിക്കാതെ നിങ്ങൾക്ക് "revenue" എന്ന് തിരയാനും canonical table, Looker dashboard, glossary definition എന്നിവ കണ്ടെത്താനും കഴിയും.
എനിക്കിഷ്ടപ്പെട്ടത്:
- Relevance റോബോട്ടുകൾക്കുവേണ്ടിയല്ല, മനുഷ്യർക്കുവേണ്ടി ട്യൂൺ ചെയ്തതായി തോന്നുന്നു.
- Faceted ഫിൽട്ടറുകൾ എന്നാൽ രണ്ട് ക്ലിക്കുകളിൽ നിങ്ങൾക്ക് “BigQuery + Dashboards + Finance domain” എന്നിതിലേക്ക് ചുരുക്കാൻ കഴിയും.
- ഫലങ്ങളിലെ Rich previews പത്ത് ടാബുകൾ തുറക്കുന്നത് ലാഭിക്കുന്നു.
2) ഉപയോഗപ്രദമായ വംശപരമ്പര (വെറുതെ മനോഹരമായതല്ല)
അതെ, വംശപരമ്പര ഗ്രാഫ് മനോഹരമാണ്. അതിലും പ്രധാനമായി, ഇത് ഉപയോഗിക്കാവുന്നതാണ്. നിങ്ങൾക്ക് മുകളിലുള്ള ഉറവിടങ്ങൾ, താഴെയുള്ള ഡാഷ്ബോർഡുകൾ, അവയെ ഒരുമിപ്പിക്കാൻ സഹായിക്കുന്ന ജോലികൾ എന്നിവ കാണാൻ കഴിയും. മുകളിലുള്ള എന്തെങ്കിലും തകരാറിലായാൽ, നിങ്ങളുടെ CFO-ക്ക് പ്രതിമാസ റിപ്പോർട്ട് പെട്ടെന്ന് ഒരു meme stock പോലെ തോന്നുന്നതിന്റെ കാരണം അറിയുന്നതിന് മുമ്പ് ആരെയാണ് അറിയിക്കേണ്ടതെന്ന് DataHub നിങ്ങളോട് പറയും.
എനിക്കിഷ്ടപ്പെട്ടത്:
- End‑to‑end lineage: ഉറവിടങ്ങൾ → രൂപാന്തരങ്ങൾ → BI.
- Context-ഓടെയുള്ള Clickable nodes: schema, ownership, health.
- Impact analysis: ഒരു കോളം മാറ്റുക, ആർക്കാണ് ദേഷ്യം വരുന്നതെന്ന് നോക്കുക.
3) ഉടമസ്ഥാവകാശവും ഡൊമെയ്നുകളും: ദേഷ്യമുള്ള ഇമെയിലുകൾ ഇല്ലാത്ത ഉത്തരവാദിത്തം
ഉടമസ്ഥരെയും ഡൊമെയ്നുകളെയും നിയമിക്കാൻ DataHub നിങ്ങളെ പ്രേരിപ്പിക്കുന്നു. അതാണ് രഹസ്യ ചേരുവ. എല്ലാ ഡാറ്റാ സെറ്റിനും ഉത്തരവാദിത്തമുള്ള ഒരു ടീമും “Marketing Analytics” അല്ലെങ്കിൽ “Finance” പോലുള്ള ഒരു ഡൊമെയ്നും ഉണ്ടെങ്കിൽ, നിങ്ങൾക്ക് എല്ലാ ചോദ്യങ്ങളിലും റാൻഡം ഡാറ്റാ എഞ്ചിനീയർമാരെ ടാഗ് ചെയ്യുന്നത് നിർത്തി ശരിയായവരെ ടാഗ് ചെയ്യാൻ തുടങ്ങാം. മാജിക്.
എനിക്കിഷ്ടപ്പെട്ടത്:
- എല്ലായിടത്തും കാണുന്ന വ്യക്തമായ ഉടമസ്ഥാവകാശ ഫീൽഡുകൾ.
- ഡൊമെയ്ൻ അടിസ്ഥാനമാക്കിയുള്ള ബ്രൗസിംഗ് പുതിയ ആളുകളെ ഓർഗിന്റെ ഡാറ്റാ മാപ്പ് പഠിക്കാൻ സഹായിക്കുന്നു.
- നിങ്ങളുടെ ഐഡന്റിറ്റി പ്രൊവൈഡറിൽ നിന്നുള്ള ഗ്രൂപ്പ്/റോൾ മാപ്പിംഗുമായി പ്രവർത്തിക്കുന്നു.
4) ഗ്ലോസറിയും ഡോക്യുമെന്റേഷനും: വാക്കുകൾ പ്രധാനമാണ് (ഒരുപാട്)
DataHub-ൻ്റെ ഗ്ലോസറിയിലാണ് നിങ്ങൾ ഒടുവിൽ “എന്താണ് ഒരു active user ആയി കണക്കാക്കുന്നത്?” എന്നതിനെക്കുറിച്ചുള്ള തർക്കം പരിഹരിക്കുന്നത്. നിർവചനങ്ങൾ യഥാർത്ഥ ആസ്തികളിലേക്ക് ലിങ്ക് ചെയ്യുക. ഉദാഹരണങ്ങൾ ചേർക്കുക. പര്യായങ്ങൾക്ക് ടാഗ് ചെയ്യുക. പെട്ടെന്ന് “MRR,” “revenue,” “ARR” എന്നിവ ശത്രുക്കളല്ല, സുഹൃത്തുക്കളായി മാറുന്നു.
എനിക്കിഷ്ടപ്പെട്ടത്:
- പട്ടികകളുടെയും ഡാഷ്ബോർഡുകളുടെയും തൊട്ടടുത്ത് തന്നെയുള്ള Rich docs.
- ഗ്ലോസറി ടേംസ് തിരയലിലും UI ബാഡ്ജുകളിലും കാണിക്കുന്നു.
- Context-ലുള്ള doc hygiene-യെ പ്രോത്സാഹിപ്പിക്കുന്നു—ആളുകൾ വായിക്കുന്നിടത്ത് എഴുതുക.
5) ഭരണവും വിശ്വാസ സിഗ്നലുകളും: വിശ്വാസത്തിന്റെ വൈറൽ വ്യാപനം
അസറ്റുകളെ “verified,” “deprecated,” അല്ലെങ്കിൽ “in review” എന്ന് ലേബൽ ചെയ്യാൻ പ്ലാറ്റ്ഫോം നിങ്ങളെ അനുവദിക്കുന്നു. വലിയ സാംസ്കാരിക സ്വാധീനമുള്ള ഒരു ചെറിയ UI flourish ആണിത്. ഒരു ഡാറ്റാ സെറ്റിന്റെ അടുത്തായി ഒരു പച്ച verified ബാഡ്ജ് കാണുമ്പോൾ, നിങ്ങളുടെ തോളുകൾ അയയും. deprecated എന്ന് കാണുമ്പോൾ, നിങ്ങൾ ടാബ് അടച്ച് ഉത്തരവാദിത്തമുള്ള ഒരു മുതിർന്ന വ്യക്തിയെപ്പോലെ നടന്നുപോകുന്നു.
എനിക്കിഷ്ടപ്പെട്ടത്:
- ഉപയോക്താക്കൾ ആദരിക്കുന്ന ബാഡ്ജുകളും ടാഗുകളും.
- കൂടുതൽ ഔപചാരികമായ ഷോപ്പുകൾക്കുള്ള പോളിസികളും അംഗീകാരങ്ങളും.
- സ്വാതന്ത്ര്യത്തിന്റെയും ഗാർഡ് റെയിലുകളുടെയും ആരോഗ്യകരമായ ബാലൻസ്.
സജ്ജീകരണവും സംയോജനവും: ഇത് നിങ്ങളുടെ വാരാന്ത്യം തകർക്കുമോ?
ചുരുക്ക ഉത്തരം: ഒരുപക്ഷെ ഇല്ല, പക്ഷേ മുൻകൂട്ടി പ്ലാൻ ചെയ്യുക. DataHub ജനപ്രിയ സ്റ്റാക്കുകൾക്കായി ഔദ്യോഗിക ingestors വാഗ്ദാനം ചെയ്യുന്നു: Snowflake, BigQuery, Redshift, Databricks, Postgres, Looker, Tableau, Power BI, Airflow, dbt, കൂടാതെ മറ്റു പലതും. നിങ്ങൾ ഒരു ഷെഡ്യൂളിൽ മെറ്റാഡാറ്റ ഇൻജക്ഷൻ ജോലികൾ പ്രവർത്തിപ്പിക്കുക, ആധികാരികത ഉറപ്പാക്കുക, ക്രാൾ ചെയ്യാൻ അനുവദിക്കുക.
- ഓപ്പൺ സോഴ്സ് ഡെപ്ലോയ്: Docker/Kubernetes. ഇൻഫ്രയിൽ പരിചയമുള്ള ഒരാൾ നിങ്ങൾക്ക് ആവശ്യമാണ്.
- നിങ്ങൾക്ക് സേവനങ്ങളെക്കുറിച്ച് കൂടുതൽ ശ്രദ്ധിക്കാൻ താൽപ്പര്യമില്ലെങ്കിൽ Cloud/managed ഓപ്ഷനുകൾ നിലവിലുണ്ട്.
- ഇൻജക്ഷൻ ആവർത്തിക്കാവുന്നതാണ്—നിങ്ങൾ ETL-നെ പരിഗണിക്കുന്നതുപോലെ ഇതിനെയും പരിഗണിക്കുക: കോഡിലുള്ള കോൺഫിഗറേഷൻ, പതിപ്പ് നിയന്ത്രിക്കുക, ഷെഡ്യൂൾ ചെയ്യുക.
യാഥാർത്ഥ്യ പരിശോധന:
- ചില ഒറ്റപ്പെട്ട തിരുത്തലുകൾ പ്രതീക്ഷിക്കുക (മോശം സ്കീമ പേരുകൾ, പഴയ ഡാഷ്ബോർഡുകൾ, അനാഥ പൈപ്പ്ലൈനുകൾ) പുറത്തുവരും. അത് നല്ലതാണ്. മെറ്റാഡാറ്റ നിങ്ങളുടെ രഹസ്യങ്ങളെ വെളിച്ചത്ത് കൊണ്ടുവരുന്നു.
- SSO/permissions സജ്ജീകരിക്കുന്നതിന് സമയം കണ്ടെത്തുക. നിങ്ങളുടെ സുരക്ഷാ ടീം അഭിപ്രായങ്ങൾ പറയും. അവരെ നേരത്തെ ക്ഷണിക്കുക.
പ്രകടനവും സ്കേലബിളിറ്റിയും: ഇത് നിലനിർത്താൻ കഴിയുമോ?
വളരുന്ന മെറ്റാഡാറ്റ ഉപയോഗിച്ച് DataHub നന്നായി സ്കെയിൽ ചെയ്യുന്നു. തിരയലിനും വംശപരമ്പരയ്ക്കുമുള്ള query വേഗത എന്റെ പരിശോധനകളിൽ നിലനിർത്തി. പ്രവർത്തനപരമായ കാര്യമാണ് വലിയ നേട്ടം: നിങ്ങൾ ഇൻജക്ഷനുകൾ സ്വയമേവ പൂർത്തിയാക്കുകയും സെൻസിബിൾ ഷെഡ്യൂളുകൾ സജ്ജമാക്കുകയും ചെയ്താൽ, നിങ്ങൾ ഹീറോ വർക്ക് ചെയ്യില്ല. വേഗതയേറിയതും വിരസവും വിശ്വസനീയവുമായ സമന്വയങ്ങൾ—അതാണ് നല്ലതരം വിരസത.
Pro tip: ആദ്യ ദിവസം തന്നെ എല്ലാത്തിനെയും ingest ചെയ്യരുത്. ആളുകൾ ഏറ്റവും കൂടുതൽ പരാതിപ്പെടുന്ന അഞ്ച് സിസ്റ്റങ്ങളിൽ നിന്ന് ആരംഭിച്ച്, അവയെ നന്നായി ടാഗ് ചെയ്ത് അവിടെ നിന്ന് വളരുക. മെറ്റാഡാറ്റ, ഇൻഡോർ പ്ലാന്റുകളും ഗ്രൂപ്പ് ചാറ്റുകളും പോലെ വെട്ടിയൊതുക്കുമ്പോൾ തഴച്ചുവളരുന്നു.
DataHub vs. നിങ്ങളുടെ ബദലുകൾ: സത്യസന്ധമായ അഭിപ്രായം
- DataHub vs. Amundsen: DataHub കൂടുതൽ മിനുസമാർന്നതായി തോന്നുന്നു, കൂടുതൽ സമ്പന്നമായ വംശപരമ്പരയും ഉടമസ്ഥാവകാശവുമുണ്ട്. Amundsen ഭാരം കുറഞ്ഞതാണ്, പക്ഷേ കാര്യങ്ങൾ ഒരുമിപ്പിക്കാൻ നിങ്ങൾ കൂടുതൽ സമയം ചെലവഴിക്കേണ്ടി വരും.
- DataHub vs. OpenMetadata: OpenMetadata-യ്ക്കും സമാനമായ ലക്ഷ്യങ്ങളും ശക്തമായ കമ്മ്യൂണിറ്റിയുമുണ്ട്. DataHub-ൻ്റെ തിരയലിനും ഭരണത്തിനും കൂടുതൽ മെച്ചപ്പെട്ടതായി തോന്നുന്നു, കൂടാതെ ആഴത്തിലുള്ള എന്റർപ്രൈസ് പാലങ്ങളുമുണ്ട്.
- DataHub vs. “Confluence ഉപയോഗിച്ച് പ്രതീക്ഷിക്കുക”: ഇല്ല.
- DataHub vs. Proprietary Catalogs: പണം നൽകി വാങ്ങുന്ന പ്ലാറ്റ്ഫോമുകൾ കൂടുതൽ turnkey compliance-ഉം UI gloss-ഉം വാഗ്ദാനം ചെയ്തേക്കാം. DataHub വഴക്കം, ഓപ്പൺ API-കൾ, ശക്തമായ വില എന്നിവ നൽകി ഇതിനെ പ്രതിരോധിക്കുന്നു.
DataHub-ൻ്റെ മികച്ച ഭാഗങ്ങൾ (സംഗീതം ആരംഭിക്കുന്നു)
- സാധാരണക്കാർക്ക് ഉപയോഗിക്കാൻ കഴിയുന്ന മികച്ച തിരയലും കണ്ടെത്തലും.
- കലയല്ലാത്ത വംശപരമ്പര. ഇത് അലാറങ്ങൾ, ഇംപാക്ട് അനാലിസിസ്, കുറഞ്ഞ കേടായ ഡാഷ്ബോർഡുകൾ എന്നിവ നൽകുന്നു.
- ഡാറ്റയെ യഥാർത്ഥ ടീമുകളുമായി ബന്ധിപ്പിക്കുന്ന ഉടമസ്ഥാവകാശവും ഡൊമെയ്ൻ മോഡലുകളും.
- ആളുകൾക്ക് ആവശ്യമുള്ളിടത്ത് ഗ്ലോസറിയും ഡോക്യുമെന്റുകളും ലഭ്യമാണ്.
- സജീവമായ കമ്മ്യൂണിറ്റിയും എക്സ്റ്റൻസിബിലിറ്റിയുമുള്ള ഓപ്പൺ സോഴ്സ് ഫൗണ്ടേഷൻ.
DataHub എവിടെയാണ് വീഴ്ച വരുത്തുന്നത് (ഒരു ടൂളും Unicorn അല്ല)
- സജ്ജീകരണം “ക്ലിക്ക് നെക്സ്റ്റ്, നെക്സ്റ്റ്, ഡൺ” എന്ന രീതിയിലുള്ളതല്ല. നിങ്ങൾക്ക് infra പരിചയവും കുറച്ച് YAML ക്ഷമയും ആവശ്യമാണ്.
- UI polish സവിശേഷതകളിൽ വ്യത്യാസപ്പെട്ടിരിക്കുന്നു. മാരകമായ ഒന്നുമില്ല, പക്ഷേ എല്ലാം Apple സ്റ്റോർ പോലെ തിളക്കമുള്ളതായി തോന്നുന്നില്ല.
- മാറ്റ മാനേജ്മെന്റ് പ്രധാനമാണ്. ഒരു ഡാറ്റാ കാറ്റലോഗ് 50% സോഫ്റ്റ്വെയറും 50% സംസ്കാരവുമാണ്. ആരും ഡോക്യുമെന്റുകൾ എഴുതിയില്ലെങ്കിൽ, ഒരു ടൂളിനും നിങ്ങളെ രക്ഷിക്കാൻ കഴിയില്ല.
ഹാൻഡ്സ്-ഓൺ: 7 ദിവസത്തെ DataHub ദ്രുത ലോഞ്ച് പ്ലാൻ
ഒരു അവലോകനം നിങ്ങൾക്ക് പ്രവർത്തിക്കാൻ കഴിയുന്നെങ്കിൽ മാത്രമേ ഉപയോഗപ്രദമാകൂ, അതിനാൽ നിങ്ങളുടെ PM-നെ സങ്കടപ്പെടുത്താത്ത ഒരു ചെറിയ ആഴ്ചയിലെ പ്ലാൻ ഇതാ.
Day 1: ആദ്യത്തെ 2–3 ഉറവിടങ്ങൾ (ഉദാഹരണത്തിന്, Snowflake, dbt, Looker) തിരഞ്ഞെടുത്ത് ലക്ഷ്യങ്ങൾ സജ്ജമാക്കുക. “മെറ്റാഡാറ്റ സ്വീകരിക്കുന്നതിനേക്കാൾ” “ഡ്യൂപ്ലിക്കേറ്റ് ഡാഷ്ബോർഡുകൾ 30% കുറയ്ക്കുക” എന്നത് നല്ലതാണ്.
Day 2: ഒരു sandbox ഡെപ്ലോയ് ചെയ്യുക. Docker Compose അല്ലെങ്കിൽ ഒരു managed ഓപ്ഷൻ ഉപയോഗിക്കുക. SSO നേരത്തെ തന്നെ ശരിയാക്കുക.
Day 3: നിങ്ങളുടെ പ്രധാന ഉറവിടങ്ങൾക്കായി ഇൻജക്ഷൻ കോൺഫിഗർ ചെയ്യുക. കോൺഫിഗറേഷനുകളുടെ പതിപ്പ് നിയന്ത്രിക്കുക. ആദ്യത്തെ സമന്വയം പ്രവർത്തിപ്പിക്കുക. നിങ്ങൾ കണ്ടെത്തുന്ന ഓരോ കേടായ ലിങ്കിനെയും ആഘോഷിക്കുക—അവ മുൻകൂട്ടിയുള്ള ബഗുകളാണ്.
Day 4: ഡൊമെയ്നുകളും ഉടമസ്ഥാവകാശവും നിർവചിക്കുക. യഥാർത്ഥ മനുഷ്യരെ നിയമിക്കുക (“ഡാറ്റാ ടീം” എന്നല്ല). ഓരോ ഡൊമെയ്നിനുമായി Slack ചാനലുകൾ ചേർക്കുക.
Day 5: അഞ്ച് ചെറിയ ഡോക്യുമെന്റുകൾ എഴുതുക. നിങ്ങളുടെ ഏറ്റവും കൂടുതൽ ഉപയോഗിക്കുന്ന പട്ടികയ്ക്ക് ഒന്ന്, ഏറ്റവും കൂടുതൽ തർക്കിക്കുന്ന KPI-ക്ക് ഒന്ന്, ഉപയോക്താക്കൾ ശപിക്കുന്ന മൂന്ന് flaky പൈപ്പ്ലൈനുകൾക്ക് മൂന്ന് എന്നിങ്ങനെ.
Day 6: “active user,” “revenue,” “churn” എന്നിവയ്ക്കായുള്ള ഗ്ലോസറി ടേംസ് ചേർക്കുക. അവയെ അസറ്റുകളിലേക്ക് ലിങ്ക് ചെയ്യുക. ബാഡ്ജുകൾ പ്രയോഗിക്കുക: verified, deprecated, in review.
Day 7: ഉച്ചഭക്ഷണവും പഠനവും ആരംഭിക്കുക. തിരയൽ, വംശപരമ്പര, ഉടമസ്ഥാവകാശം എന്നിവയുടെ ഡെമോ നൽകുക. അത് റെക്കോർഡ് ചെയ്യുക. ഒരു ഫീഡ്ബാക്ക് ഫോം ചേർക്കുക. Slack-ൽ പിൻ ചെയ്യുക. കുക്കികൾ നൽകി പ്രേരിപ്പിക്കുക. നല്ല തരം കുക്കികൾ.
വിവിധ ടീമുകൾക്കുള്ള DataHub: ആർക്കാണ് എന്ത് നേടാൻ കഴിയുക
- വിശകലന വിദഗ്ദ്ധർ: വേഗത്തിലുള്ള കണ്ടെത്തൽ, കുറഞ്ഞ പിംഗുകൾ, വ്യക്തമായ KPI നിർവചനങ്ങൾ. “സംഖ്യ ശരിയാണെന്ന് ഞാൻ ഉറപ്പ് നൽകുന്നു” എന്ന് പറയേണ്ടി വരുന്ന അവസ്ഥ കുറയുന്നു.
- ഡാറ്റാ എഞ്ചിനീയർമാർ: ഉടമസ്ഥാവകാശ വ്യക്തത, മാറ്റങ്ങൾ വരുത്തുന്നതിന് മുമ്പുള്ള ഇംപാക്ട് അനാലിസിസ്, കുറഞ്ഞ സപ്പോർട്ട് ടിക്കറ്റുകൾ.
- BI ഡെവലപ്പർമാർ: വംശപരമ്പര അറിയുന്ന ഡെപ്ലോയ്മെന്റുകൾ, വിശ്വസനീയമായ ഡാഷ്ബോർഡുകൾ, ചെറിയ ബാക്ക്ലോഗുകൾ.
- Product Managerമാർ: ഡാഷ്ബോർഡ് സ്വയം കണ്ടെത്തുന്നു (ഒരു അത്ഭുതം). മുകളിലുള്ള അപകടസാധ്യത മനസ്സിലാക്കുന്നു.
- സുരക്ഷ/കംപ്ലയിൻസ്: ഭരണ ലേബലുകൾ, ഓഡിറ്റ് ചെയ്യാൻ എളുപ്പമുള്ള വംശപരമ്പരയും ഉടമസ്ഥാവകാശവും.
സാംസ്കാരിക ഭാഗം: മെറ്റാഡാറ്റാ പോലീസാകാതെ എങ്ങനെ നിലനിർത്താം
- ഉടമസ്ഥാവകാശം പരസ്യമാക്കുക. എല്ലാം “Data”യുടെ ഉടമസ്ഥതയിലാണെങ്കിൽ, ആരുടെയും ഉടമസ്ഥതയിലല്ല.
- ഡോക്യുമെന്റ് സംഭാവനകൾക്ക് പ്രതിഫലം നൽകുക. സ്റ്റാൻഡ്-അപ്പുകളിലെ Shout‑outs സൗജന്യവും വളരെ ഫലപ്രദവുമാണ്.
- PR-കളിലേക്ക് കാറ്റലോഗ് അപ്ഡേറ്റുകൾ ചേർക്കുക. നിങ്ങൾ ഒരു കോളം റീനെയിം ചെയ്യുകയും ഡോക്യുമെന്റുകൾ അപ്ഡേറ്റ് ചെയ്യാതിരിക്കുകയും ചെയ്താൽ, ഒരു ബെൽ അടിക്കുകയും ഒരു ഡാറ്റാ എഞ്ചിനീയർക്ക് ഒരു കോഫി നഷ്ടപ്പെടുകയും വേണം.
വിലയും മൂല്യവും: ഓപ്പൺ സോഴ്സ് എന്നാൽ സൗജന്യ യൂണികോൺ എന്നല്ല അർത്ഥം
DataHub-ൻ്റെ ഓപ്പൺ സോഴ്സ് കോർ പ്രവർത്തിപ്പിക്കാൻ സൗജന്യമാണ്, പക്ഷേ നിങ്ങൾ സമയം നൽകേണ്ടിവരും: സജ്ജീകരണം, ഹോസ്റ്റിംഗ്, മെയിന്റനൻസ്. വഴക്കത്തിനും ദീർഘകാല നിയന്ത്രണത്തിനും വേണ്ടി പല ടീമുകളും അത് ചെയ്യുന്നു. Managed ഓഫറുകൾ സൗകര്യം, SLA-കൾ, എന്റർപ്രൈസ് ഫീച്ചറുകൾ എന്നിവ നൽകുന്നു. നിങ്ങളുടെ സ്പ്രെഡ്ഷീറ്റ് ഏത് രീതിയിലും നിങ്ങൾക്ക് നന്ദി പറയും.
സുരക്ഷയും സ്വകാര്യതയും: അതെ, നിങ്ങളുടെ നിയമപരമായ ടീം ചോദിക്കും
DataHub നിങ്ങളുടെ യഥാർത്ഥ ഡാറ്റയല്ല, മെറ്റാഡാറ്റയാണ് സംഭരിക്കുന്നത്. എന്നിരുന്നാലും, ഏതൊരു പ്രധാനപ്പെട്ട സിസ്റ്റത്തെയും പോലെ ഇതിനെ പരിഗണിക്കുക:
- ആദ്യ ദിവസം മുതൽ SSO-യും RBAC-യും സംയോജിപ്പിക്കുക.
- നിങ്ങൾക്ക് ആവശ്യമുള്ളത് മാത്രം ingest ചെയ്യാൻ ശ്രമിക്കുക.
- ഓഡിറ്റ് ലോഗുകൾ സൂക്ഷിക്കുക. ആരാണ് എന്താണ് ചെയ്തതെന്ന് അറിയാൻ ഇത് ഭാവിയിൽ നിങ്ങൾക്ക് ഉപകാരപ്രദമാകും.
ഞാൻ പ്രതീക്ഷിക്കാത്ത ചെറിയ സന്തോഷങ്ങൾ
- പവർ യൂസർമാർക്കുള്ള കീബോർഡ് കുറുക്കുവഴികൾ. തിരയുക, ഫിൽട്ടർ ചെയ്യുക, പൂർത്തിയായി.
- മറ്റൊരു ടൂളിലേക്ക് പോകേണ്ട ആവശ്യമില്ലാത്ത ഇൻലൈൻ കോളം-ലെവൽ വിവരണങ്ങൾ.
- ഡോക്യുമെന്റുകളും ഉടമസ്ഥരെയും ചേർക്കാൻ പ്രേരിപ്പിക്കുന്ന സൂക്ഷ്മമായ nudges—നിങ്ങളുടെ ഫ്രിഡ്ജ് സൌമ്യമായി പുനഃസംഘടിപ്പിക്കുന്ന വൃത്തിയുള്ള ഒരു സുഹൃത്തിനെപ്പോലെ.
ആരാണ് DataHub ഒഴിവാക്കേണ്ടത് (ഇപ്പോൾ)
- ഒരൊറ്റ വെയർഹൗസും വിശ്വസനീയമായ അഞ്ച് ഡാഷ്ബോർഡുകളും ഉള്ള ചെറിയ ടീമുകൾ. ഒരു ഷെയർഡ് README മതിയാകും. മതിയായേക്കാം എന്നതിന് ഊന്നൽ നൽകുന്നു.
- പ്രോസസ് അലർജിയുള്ള സ്ഥാപനങ്ങൾ. നിങ്ങളുടെ ടീം ഉടമസ്ഥരെ ചേർക്കാനോ ഒരു വരി ഡോക്യുമെന്റുകൾ എഴുതാനോ വിസമ്മതിക്കുകയാണെങ്കിൽ, ഒരു കാറ്റലോഗിനും നിങ്ങളെ രക്ഷിക്കാൻ കഴിയില്ല.
വിധി: എന്റെ DataHub അവലോകനത്തിന്റെ അടിവര
നിങ്ങളുടെ കമ്പനിക്ക് ഒന്നിൽ കൂടുതൽ ഡാറ്റാ സ്റ്റോറുകളും മൂന്നിൽ കൂടുതൽ ഡാഷ്ബോർഡുകളും പൂജ്യത്തിൽ കൂടുതൽ ആശയക്കുഴപ്പമുള്ള ആളുകളും ഉണ്ടെങ്കിൽ, DataHub ഗൗരവമായി പരിഗണിക്കേണ്ട ഒന്നാണ്. ഇത് അടിസ്ഥാനകാര്യങ്ങൾ ശരിയായി ചെയ്യുന്നു—തിരയൽ, വംശപരമ്പര, ഉടമസ്ഥാവകാശം—കൂടാതെ “എവിടെയോ ഡാറ്റ” എന്നതിൽ നിന്ന് “ആർക്കും കണ്ടെത്താനും മനസ്സിലാക്കാനും തകരാറിലാക്കാതിരിക്കാനും കഴിയുന്ന ഡാറ്റ” എന്നതിലേക്ക് വളരാൻ നിങ്ങൾക്ക് ഒരു പ്ലാറ്റ്ഫോം നൽകുന്നു.
ശ്രദ്ധിക്കേണ്ട ഒരു കാര്യം: നിങ്ങളുടെ സ്റ്റാക്ക് വിലയിരുത്തുന്നതിനോ ഡോക്യുമെന്റ് ചെയ്യുന്നതിനോ നിങ്ങൾക്ക് മികച്ച ഒരു സഹ-പൈലറ്റ് വേണമെങ്കിൽ, Sider.AIക്ക് നിങ്ങളുടെ കുഴഞ്ഞുമറിഞ്ഞ ഡോക്യുമെന്റുകൾ സംഗ്രഹിക്കാനും ഓപ്ഷനുകൾ താരതമ്യം ചെയ്യാനും DataHub-നെ നിങ്ങളുടെ സിസ്റ്റങ്ങളുമായി ബന്ധിപ്പിക്കുമ്പോൾ നിങ്ങളുടെ കുറിപ്പുകൾ വൃത്തിയായി സൂക്ഷിക്കാനും സഹായിക്കാനാകും. നിങ്ങൾ മാനുവൽ വായിക്കേണ്ടതില്ലാത്ത, തുടർന്ന് അത് ലളിതമായ ഇംഗ്ലീഷിൽ വിശദീകരിക്കുന്ന ഒരു സുഹൃത്തായി ഇതിനെ കരുതുക. ദ്രുത Pros and Cons (നിങ്ങൾക്ക് തിരക്കുള്ളതുകൊണ്ട്)
Pros:
- മികച്ച തിരയലും പ്രായോഗികമായ വംശപരമ്പരയും
- യഥാർത്ഥ ഉത്തരവാദിത്തം നൽകുന്ന ഉടമസ്ഥാവകാശം, ഡൊമെയ്നുകൾ, ഗ്ലോസറി
- ഓപ്പൺ‑സോഴ്സ് വഴക്കവും ശക്തമായ എക്കോസിസ്റ്റവും
- വിശ്വാസം വളർത്തുന്ന ഭരണ ബാഡ്ജുകൾ
Cons:
- സജ്ജീകരണത്തിനും ഇൻഫ്രയ്ക്കും യഥാർത്ഥ ശ്രമം ആവശ്യമാണ്
- UI polish ചിലയിടങ്ങളിൽ ഒരുപോലെയല്ല
- പൂർണ്ണമായ മൂല്യത്തിന് സാംസ്കാരിക മാറ്റം നിർബന്ധമാണ്
നിങ്ങൾക്ക് സ്ക്രീൻഷോട്ട് എടുക്കാൻ കഴിയുന്ന അവസാന നിഗമനങ്ങൾ
- ചെറുതായി തുടങ്ങുക: പ്രധാനപ്പെട്ട 3 ഉറവിടങ്ങൾ, വ്യക്തമായ ഉടമസ്ഥർ, അഞ്ച് ഡോക്യുമെന്റുകൾ, മൂന്ന് ഗ്ലോസറി ടേംസ്.
- ഇൻജക്ഷൻ സ്വയമേവ പൂർത്തിയാക്കുക, തുടർന്ന് കൂടുതൽ കാര്യങ്ങൾ സ്വയമേവ പൂർത്തിയാക്കുക.
- കാറ്റലോഗിനെ ഒരു ഉൽപ്പന്നമായി പരിഗണിക്കുക: റോഡ്മാപ്പുകൾ, ഉടമസ്ഥർ, ഫീഡ്ബാക്ക് ലൂപ്പുകൾ.
- ഉപയോഗപ്രദമായതിനെ തടയാൻ പൂർണ്ണതയെ അനുവദിക്കരുത്. ഒരു ശരാശരി വിവരണം ഒരു ശൂന്യമായ ബോക്സിനേക്കാൾ നല്ലതാണ്, എല്ലാ ഇപ്പോളും.
DataHub ഒരു വ്യക്തിയായിരുന്നെങ്കിൽ, അത് ഓഫീസ് ഫ്രിഡ്ജിൽ ലേബൽ ഒട്ടിക്കുകയും കലണ്ടർ ഓർമ്മപ്പെടുത്തലുകൾ സജ്ജീകരിക്കുകയും ആരെയും ബുദ്ധിമുട്ടിക്കാതെ എല്ലാവരെയും അനുസരിപ്പിക്കുകയും ചെയ്യുന്ന ഒരു സഹപ്രവർത്തകനായിരിക്കും. അലഞ്ഞുതിരിയുന്ന ഡാഷ്ബോർഡുകളും നിഗൂഢമായ അളവുകളുമുള്ള ഒരു ലോകത്ത്, സ്പീഡ് ഡയലിൽ നിങ്ങൾ ആഗ്രഹിക്കുന്ന ഹീറോ അതാണ്.
FAQ
Q1:ചെറിയ ടീമുകൾക്ക് DataHub നല്ലതാണോ അതോ അമിതമാണോ?
നിങ്ങൾക്ക് ഒരു വെയർഹൗസും അഞ്ച് ഡാഷ്ബോർഡുകളും മാത്രമേയുള്ളൂ എങ്കിൽ, DataHub ഒരു അധിക ആവശ്യമായിരിക്കാം. ഒരു ഷെയർഡ് ഡോക്യുമെന്റ് പ്രവർത്തിച്ചേക്കാം. നിങ്ങൾ കൂടുതൽ ഉറവിടങ്ങൾ, കൂടുതൽ ആളുകൾ, കൂടുതൽ ആശയക്കുഴപ്പം എന്നിവ ചേർക്കുമ്പോൾ, ഈ ഡാറ്റാ കാറ്റലോഗ് കുറഞ്ഞ പിംഗുകളിലും വ്യക്തമായ നിർവചനങ്ങളിലും സ്വയം പണം നൽകാൻ തുടങ്ങും.
Q2:മറ്റ് ഡാറ്റാ കാറ്റലോഗുകളുമായി താരതമ്യപ്പെടുത്തുമ്പോൾ DataHub സജ്ജീകരിക്കാൻ എത്ര ബുദ്ധിമുട്ടാണ്?
ഇത് ഒറ്റ ക്ലിക്കിൽ കഴിയുന്ന ഒന്നല്ല, പക്ഷേ Docker/Kubernetes-ൽ പരിചയമുണ്ടെങ്കിൽ കുറച്ച് YAML-കളിലൂടെ ചെയ്യാവുന്നതാണ്. ഇൻജക്ഷൻ ചട്ടക്കൂട് ശക്തമാണ്, നിങ്ങൾ സേവനങ്ങളെക്കുറിച്ച് കൂടുതൽ ശ്രദ്ധിക്കാൻ ആഗ്രഹിക്കുന്നില്ലെങ്കിൽ, managed ഓപ്ഷനുകൾ കാര്യങ്ങൾ എളുപ്പമാക്കുന്നു.
Q3:DataHub-ൻ്റെ വംശപരമ്പരയെ ഒരു മനോഹരമായ ഗ്രാഫിനെക്കാൾ മികച്ചതാക്കുന്നത് എന്താണ്?
ഇംപാക്ട് അനാലിസിസും ഉടമസ്ഥാവകാശവുമാണ്. ആളുകൾ ശരിക്കും ശ്രദ്ധിക്കുന്ന ഡാഷ്ബോർഡുകളിലേക്കുള്ള മുകളിലേക്കുള്ള മാറ്റങ്ങൾ നിങ്ങൾക്ക് കണ്ടെത്താനാകും, തുടർന്ന് സംഖ്യകൾ തെറ്റായി പോകുന്നതിന് മുമ്പ് ശരിയായ ആളുകളെ അറിയിക്കാനാകും. ഇത് തീപിടുത്തങ്ങൾ ഉണ്ടാക്കുന്നതിന് പകരം തടയുന്ന വംശപരമ്പരയാണ്.
Q4:DataHub-ന് ഭരണപരവും നിയമപരവുമായ ആവശ്യകതകൾ കൈകാര്യം ചെയ്യാൻ കഴിയുമോ?
മെറ്റാഡാറ്റാ തലത്തിൽ കഴിയും: verified/deprecated ബാഡ്ജുകൾ, ഉടമസ്ഥാവകാശം, ഡൊമെയ്നുകൾ, പോളിസികൾ. വലിയ നിയമപരമായ ആവശ്യങ്ങൾക്ക്, നിങ്ങളുടെ നിലവിലുള്ള നിയന്ത്രണങ്ങളുമായി ഇതിനെ ജോടിയാക്കുക—ഓഡിറ്റുകൾ നിധി വേട്ടയാകാതിരിക്കാൻ DataHub നിങ്ങൾക്ക് മാപ്പും ലേബലുകളും നൽകുന്നു.
Q5:പ്രൊപ്രൈറ്ററി ഡാറ്റാ കാറ്റലോഗുകളുമായി DataHub എങ്ങനെ താരതമ്യം ചെയ്യുന്നു?
പ്രൊപ്രൈറ്ററി ടൂളുകൾക്ക് turnkey ഭരണവുമായി കൂടുതൽ തിളക്കമുണ്ടാകാം. DataHub-ൻ്റെ പ്രധാന ആകർഷണം ഓപ്പൺ‑സോഴ്സ് വഴക്കവും ശക്തമായ തിരയലും യഥാർത്ഥ ലോകത്ത് ഉപയോഗിക്കാവുന്ന വംശപരമ്പരയുമാണ്. നിങ്ങൾ നിയന്ത്രണത്തിനും കമ്മ്യൂണിറ്റിക്കും വില കൽപ്പിക്കുന്നുണ്ടെങ്കിൽ, ഇത് തിരഞ്ഞെടുക്കാൻ നല്ലതാണ്.