Bỏ qua nội dung

Làm Data Engineer ở Big Tech, công ty truyền thống và startup

Cùng là Data Engineer, nhưng công việc ở Big Tech, công ty truyền thống và startup có thể rất khác nhau. Khác biệt không chỉ ở lượng dữ liệu. Khác biệt lớn hơn nằm ở mức độ chuẩn hóa, tốc độ thay đổi, ownership, chất lượng platform và cách tổ chức ra quyết định.

Bài này không xếp hạng môi trường nào “tốt hơn”. Mục tiêu là giúp bạn chọn nơi phù hợp với giai đoạn nghề nghiệp và kiểu học của mình.

Để đọc bài này hiệu quả hơn, nên nắm các concept nền: Data Engineer Role, Data Platform Architecture, Data Ownership, Data Governance.

So sánh nhanh

Khía cạnhBig TechCông ty truyền thốngStartup
Quy mô dữ liệuLớn, nhiều hệ thống, nhiều ràng buộcVừa đến lớn, thường có legacyNhỏ đến vừa, tăng nhanh nếu sản phẩm thành công
PlatformNội bộ mạnh, chuẩn caoPha trộn legacy và cloudDùng managed service để đi nhanh
OwnershipChia nhỏ theo domain hoặc platformCó thể theo phòng banRộng, một người làm nhiều việc
Quy trìnhReview, RFC, incident process rõQuy trình nhiều, thay đổi chậmÍt quy trình, nhiều quyết định nhanh
Học đượcScale, reliability, engineering disciplineMigration, governance, stakeholder managementEnd-to-end ownership, product thinking
Rủi roPhạm vi hẹp, khó thấy toàn cảnhLegacy và chính trị tổ chứcThiếu mentor, nợ kỹ thuật nhanh

Big Tech: học chuẩn và scale

Ở Big Tech, bạn thường không phải tự dựng mọi thứ từ đầu. Platform, CI/CD, observability, security và review process đã khá trưởng thành. Các thực hành kiểu SRE và đo delivery bằng metric như DORA xuất hiện nhiều hơn vì hệ thống có nhiều team cùng phụ thuộc: Google SRE Book, DORA metrics. Bù lại, phạm vi công việc có thể hẹp: tối ưu một phần ingestion, một service, một domain hoặc một lớp platform.

Phù hợp nếu bạn muốn học:

  • Distributed systems ở quy mô lớn.
  • Cách viết design doc và review kỹ thuật nghiêm túc.
  • Reliability, on-call, incident management.
  • Data governance và privacy ở môi trường nhiều người dùng.

Điểm cần để ý: đừng để mình chỉ biết hệ thống nội bộ. Hãy luôn dịch kiến thức ra nguyên lý phổ quát: partitioning, backpressure, schema evolution, access control, SLO.

Liên quan trong site: Partitioning, Backpressure Handling, Schema Evolution, Access Control.

Công ty truyền thống: học chuyển đổi và governance

Ngân hàng, bảo hiểm, bán lẻ, logistics, telco hoặc doanh nghiệp sản xuất thường có dữ liệu quan trọng, nhiều hệ thống legacy và yêu cầu kiểm soát cao. Công việc không “hào nhoáng” nhưng rất thực tế.

Bạn sẽ học:

  • Migration từ ETL cũ sang cloud/lakehouse.
  • Quản trị dữ liệu, phân quyền, audit, retention.
  • Làm việc với stakeholder không kỹ thuật.
  • Reconciliation và chất lượng dữ liệu trong môi trường nhiều nguồn.

Điểm khó là tốc độ thay đổi chậm và quyết định kỹ thuật phụ thuộc nhiều vào quy trình mua sắm, compliance và cấu trúc tổ chức.

Liên quan trong site: Data Governance, Audit Logging, Data Classification.

Startup: học ownership và tốc độ

Ở startup, Data Engineer thường làm rộng: ingestion, warehouse, dashboard, event tracking, cost, đôi khi cả analytics và backend. Bạn thấy toàn bộ vòng đời dữ liệu rất nhanh.

Bạn sẽ học:

  • Chọn công nghệ vừa đủ.
  • Xây pipeline end-to-end từ số không.
  • Nói chuyện trực tiếp với product, sales, marketing, finance.
  • Ưu tiên cái tạo giá trị tuần này thay vì kiến trúc hoàn hảo.

Rủi ro lớn là thiếu chuẩn: không test, không ownership, không data contract, không runbook. Nếu không cẩn thận, nợ kỹ thuật dữ liệu sẽ lớn nhanh hơn sản phẩm.

Cùng một yêu cầu, ba thế giới khác nhau

Thử lấy một yêu cầu quen thuộc: “team growth muốn track funnel đăng ký user mới”.

Ở Big Tech, event schema phải đăng ký vào hệ thống tracking nội bộ, qua review về privacy (PII), có data contract với producer, rồi dữ liệu tự chảy vào warehouse qua platform ingestion có sẵn. Bạn viết ít code, nhưng phải hiểu và thuyết phục được 3-4 hệ thống/team liên quan. Thời gian: vài tuần, phần lớn là quy trình — đổi lại kết quả gần như chắc chắn đúng và không sập.

Ở công ty truyền thống, dữ liệu đăng ký nằm trong CRM đóng gói (không có event stream), bạn phải đàm phán lịch CDC hoặc batch export với vendor, xin quyền qua security, và reconcile số liệu với báo cáo phòng kinh doanh đang có sẵn. Kỹ năng quyết định thành bại là stakeholder management chứ không phải code.

Ở startup, bạn tự thêm tracking vào backend (hoặc cắm Segment/PostHog), tự dựng bảng trong warehouse, tự viết dashboard — xong trong 2-3 ngày. Nhanh và học được toàn trình, nhưng cũng chính bạn phải nhớ rằng cái schema quyết định trong 30 phút hôm nay sẽ là legacy mà chính bạn migrate sau 18 tháng.

Bài học rút ra: cùng một kỹ năng “làm pipeline” nhưng kỹ năng thứ hai được rèn hoàn toàn khác nhau — quy trình ở Big Tech, đàm phán ở công ty truyền thống, ưu tiên hóa ở startup. Chọn môi trường chính là chọn kỹ năng thứ hai này.

Chọn theo giai đoạn nghề nghiệp

  • Mới vào nghề: chọn nơi có mentor và code review tốt quan trọng hơn logo công ty.
  • Junior to Middle: chọn nơi cho bạn sở hữu pipeline production thật.
  • Senior: chọn nơi có bài toán trade-off rõ: reliability, cost, scale, governance.
  • Muốn làm platform/architect: ưu tiên môi trường có nhiều team dùng chung dữ liệu.
  • Muốn làm gần business: startup hoặc analytics-heavy company cho bạn phản hồi nhanh hơn.

Câu hỏi nên hỏi khi phỏng vấn

  • Team có on-call cho data pipeline không?
  • Ai sở hữu data quality khi dashboard sai?
  • Pipeline deploy qua CI/CD hay thủ công?
  • Có design doc/RFC cho thay đổi kiến trúc lớn không?
  • Chi phí warehouse/lakehouse được theo dõi theo team hay project không?
  • Người mới mất bao lâu để đưa pipeline đầu tiên lên production?

Kết luận

Big Tech dạy bạn chuẩn và scale. Công ty truyền thống dạy bạn governance và migration. Startup dạy bạn ownership và tốc độ. Nơi tốt nhất là nơi bài toán hiện tại ép bạn phát triển đúng năng lực còn thiếu, nhưng vẫn có đủ người và quy trình để bạn không học bằng cách gây sự cố lặp lại.

References

Bình luận & Thảo luận