I2V Studio – Tool tạo video AI tự động bằng Google Flow
Gõ một ý tưởng, nhận về một video hoàn chỉnh. App chạy trên máy bạn, dùng tài khoản Google của chính bạn — mua giấy phép một lần, không trả tiền theo từng video.

Giới thiệu phần mềm
I2V Studio là app desktop cài trên máy bạn. Bạn gõ một ý tưởng, app mở Chrome bằng chính tài khoản Google của bạn, hỏi Gemini hoặc ChatGPT ra kịch bản, sinh clip trên Google Flow, đọc lời dẫn, burn phụ đề rồi ghép tất cả thành một video hoàn chỉnh. Không có máy chủ trung gian, không ai giữ tài khoản của bạn.
Khác với các dịch vụ làm video AI trên web, bạn trả tiền một lần cho giấy phép vĩnh viễn. Credit sinh video là credit gói Google AI Pro hoặc Ultra mà bạn đã mua — app chỉ ước tính trước một video tốn bao nhiêu credit và các tài khoản của bạn còn bao nhiêu, rồi để bạn quyết định có dựng hay không.
App đi kèm 96 mẫu kịch bản dựng sẵn, chia theo ngành: thời trang, làm đẹp, sức khoẻ, ẩm thực, sách, công nghệ, nông nghiệp, quảng cáo bán hàng, và kho mẫu còn được bổ sung thêm ở những bản cập nhật sau. Mỗi mẫu là một cách làm video khác nhau. Chọn mẫu rồi app sẽ hỏi chatbot xem hôm nay có chủ đề gì đáng làm; bạn chọn trong danh sách nó đưa ra, duyệt kịch bản, rồi mới tới lượt tiêu credit.
Toàn bộ dự án, video xuất ra và phiên đăng nhập Google nằm trên ổ đĩa của bạn. App không thu thêm đồng nào sau khi bán giấy phép và không bao giờ chạm tới mật khẩu của bạn — nó chỉ mở cửa sổ Chrome rồi đứng đợi bạn đăng nhập xong.
Video demo
Demo I2V Studio: từ một ý tưởng tới video hoàn chỉnh
Xem video demo trên YouTubeThời lượng: 3:22
Demo tạo video tự động bằng AI trên Google Flow
Xem video demo trên YouTubeThời lượng: 3:03
Một ý tưởng, năm bước, một video hoàn chỉnh
Màn tạo video đi theo năm chặng rõ ràng: chọn chatbot (mẫu kịch bản), chọn chủ đề, duyệt kịch bản, dựng video, xuất bản. Hai bước đầu không tốn credit Google, nên bạn xem thoải mái trước khi quyết định.
Ở bước chọn chủ đề, app mở chatbot của mẫu bằng tài khoản Google của bạn và hỏi hôm nay có chủ đề gì đáng làm — thường trả lời trong khoảng nửa phút. Bạn chọn một trong các chủ đề nó đưa ra hoặc tự gõ chủ đề của mình, ép thời lượng video từ 30 đến 180 giây, và khai trước kiểu giọng cho từng nhân vật để mọi cảnh nói đúng một giọng.
Kịch bản trả về được tách thành từng cảnh, mỗi cảnh có lời đọc, prompt tiếng Anh cho model dựng hình và mốc thời gian riêng. Đây là chốt chặn trước khi tiêu credit: bạn đọc lại từng cảnh, sửa lời thoại, sửa prompt, thêm hoặc bớt cảnh, hoặc nhờ AI viết lại cả kịch bản.
Sinh clip chạy trên Google Flow với bốn model video: Omni 1.1 Flash (chọn được clip 4, 6, 8 hoặc 10 giây, tốn 7–15 credit mỗi lần), Veo 3.1 Lite (10 credit), Veo 3.1 Fast và Veo 3.1 Quality. Chọn model nào là quyền của bạn, app hiện giá trước khi bấm.
Không phải mẫu nào cũng đi đúng năm bước ấy. Mẫu bán sản phẩm thay vòng gợi ý chủ đề bằng một biểu mẫu để bạn khai sản phẩm; mẫu có nhiều cách chế biến chèn thêm một bước chọn cách làm. Thanh tiến trình đổi theo từng mẫu chứ không ép mọi dự án vào cùng một khuôn.

Xem trước từng khung hình rồi mới tiêu credit
Với các mẫu đi đường ảnh, bước ba mang tên “Duyệt kịch bản & ảnh” và chia làm hai chặng. Chặng một dựng ảnh tĩnh cho từng cảnh bằng Nano Banana trên Google Flow — app báo rõ chặng này không trừ credit, nên cứ chọn bậc ảnh đẹp nhất và dựng lại tới khi ưng.
Bạn duyệt bộ ảnh trước mắt mình rồi mới sang chặng hai: chọn model video, xem app báo tốn bao nhiêu credit, rồi mới biến ảnh thành clip. Nhờ vậy cái bạn trả credit để dựng là khung hình bạn đã nhìn thấy và đồng ý, không phải một canh bạc.
Sửa ô prompt ảnh của một cảnh thì tấm ảnh cũ và clip dựng từ nó đều bị bỏ — app nói thẳng điều đó ngay dưới ô nhập thay vì để bạn phát hiện bằng một hoá đơn credit.
Bảng bên phải tổng kết bộ ảnh trước khi chạy: bao nhiêu cảnh, sắp dựng mấy tấm, chi phí bao nhiêu. Ảnh các cảnh còn được dựng nối tiếp nhau để bối cảnh và ánh sáng không nhảy mỗi cảnh một kiểu.

Studio dựng cảnh: sửa đúng cảnh cần sửa, không dựng lại cả video
Mỗi dự án mở ra một bàn dựng: khung xem trước từng cảnh, timeline phân cảnh, và một cột bên phải để chỉnh nội dung, clip, âm thanh, phụ đề của riêng cảnh đang chọn.
Đây là chỗ tiết kiệm credit nhiều nhất. Model sinh sai một cảnh thì bạn sửa prompt của đúng cảnh đó rồi bấm tạo lại — app hiện luôn lần tạo lại này tốn bao nhiêu credit. Bốn cảnh còn lại đã đạt thì giữ nguyên, không phải dựng lại từ đầu.
Lời dẫn, giọng đọc và phụ đề cũng sửa được ngay tại đây. Đổi giọng cho một cảnh, chỉnh lại câu phụ đề bị AI đọc sai, rồi xuất lại video — phần không đổi không bị dựng lại.
Timeline cho biết cảnh nào đã có clip, cảnh nào chưa, cảnh nào đã có phụ đề. Nhân bản một cảnh, thêm cảnh mới hoặc xoá cảnh thừa đều làm được trước khi xuất bản.

96 mẫu kịch bản dựng sẵn, mỗi mẫu một kiểu video
Kho mẫu nằm ngay ở bước một của màn tạo video. Mỗi mẫu là một bộ não viết kịch bản riêng — một persona, một khuôn kịch bản và ảnh minh hoạ — tương ứng một kiểu video: KOC review sản phẩm, hoạt hình nhân vật, người que kể chuyện, POV mẹo vặt, cổ nhân bán sách, PT gymer ảo và nhiều kiểu khác.
Lưới mẫu chia theo chín ngành, mỗi chip ghi sẵn ngành đó có bao nhiêu mẫu, và ô tìm nhận cả chữ không dấu. Bấm một tấm thẻ là xem thử ngay đoạn video mà mẫu ấy làm ra — bấm lại để dừng. Chọn xong mẫu mới tới lượt hỏi chatbot, và cả quãng này chưa tốn đồng credit nào.
Nút Tùy chỉnh mẫu mở một bảng nói rõ mẫu ấy làm video theo kiểu nào trước khi bạn dựng: nhịp mấy giây một cảnh, video giữ tiếng Veo dựng ra hay lồng giọng đọc, cảnh sau có mở bằng khung cuối của cảnh trước không, đoạn phong cách hình được chép vào mọi prompt, và kho ví dụ mà chatbot học theo. Bảy mẫu ghim được nhân vật bằng một tấm ảnh để nhân vật giữ nguyên diện mạo qua nhiều video.
Nội dung mẫu dựng sẵn đi kèm bản cài và cố ý không cho sửa: chỉ cần đổi một ví dụ prompt là khuôn kịch bản của cả mẫu lệch đi, mà bản cập nhật sau cũng ghi đè lên nó. Đổi lại, mỗi bản cập nhật thường thêm mẫu mới vào kho, bạn cài đè là có ngay mà không phải trả thêm tiền. Thứ thuộc về riêng bạn là ảnh nhân vật của từng mẫu — ảnh này nằm trong thư mục dữ liệu trên máy bạn nên cài đè lúc cập nhật không đụng tới.

Ghim nhân vật cho kênh: mọi video cùng một người
Mỗi mẫu có một hộp tuỳ chỉnh riêng, và thứ đáng giá nhất trong đó là tấm ảnh nhân vật của kênh. App đính tấm ảnh này vào mọi cảnh khi dựng clip, nên các cảnh ra đúng một người. Không có nó thì mỗi cảnh Google Flow tự nghĩ lại một khuôn mặt từ đoạn chữ — quần áo thì trùng, mặt thì lệch đi một chút.
Ảnh nhân vật dựng ngay trong app và không tốn credit Google: app mở Flow bằng tài khoản của bạn rồi xin một tấm chân dung toàn thân từ chính đoạn tả nhân vật. Muốn đúng ý hơn thì tải ảnh của riêng bạn lên — ảnh đứng thẳng, nhìn vào máy quay, nền trơn, không lẫn người khác.
Đoạn tả nhân vật viết bằng tiếng Anh và được chép nguyên văn vào đầu mọi prompt hình. Sửa nó thì app sửa luôn tiền tố trong các ví dụ prompt của mẫu, vì chatbot học theo ví dụ chứ không theo lời dặn — để nguyên ví dụ cũ thì bản sửa không ăn.
Cùng hộp đó còn khai phong cách hình — đoạn chép vào cuối mọi prompt hình để cảnh nào cũng cùng một chất ảnh — cùng nhịp cảnh của mẫu và cách xử lý tiếng trong video. Đây là chỗ biến một mẫu dựng sẵn thành kênh của riêng bạn.

Giọng đọc: năm nguồn, phụ đề khớp từng từ
Edge là nguồn mặc định: 8 giọng Việt, Anh, Nhật, Hàn, Trung, miễn phí, không cần khai báo gì, và cho mốc thời gian từng từ nên phụ đề khớp chính xác.
CapCut thêm 24 giọng tiếng Việt có tính cách — giọng bản tin, giọng review phim, giọng kể chuyện — thay vì giọng đọc phẳng. Cũng miễn phí và không cần khai báo, nhưng đi qua một đường không chính thức nên app nói thẳng là nó có thể ngừng chạy.
Piper và VieNeu chạy hoàn toàn trên máy: bấm nút tải model một lần (20–63 MB mỗi giọng) là sau đó không cần mạng, không ai đếm lượt. Đổi lại, hai nguồn này không trả mốc thời gian nên phụ đề được rải đều theo độ dài từ — hơi lệch ở câu có từ ngắn xen từ dài, và giao diện nói trước chứ không giấu.
ElevenLabs cho chất giọng hay nhất, dùng khoá API của chính bạn và tính tiền theo ký tự với ElevenLabs. Khoá lưu trong thư mục dữ liệu trên máy bạn và không bao giờ hiện lại nguyên văn ra giao diện. Giọng chưa sẵn sàng bị chặn ngay lúc bấm xác nhận, không phải lúc ghép — để không mất cả loạt credit cho một video chết ở bước cuối.

Chạy trên máy bạn, bằng tài khoản Google của bạn
Bạn tự thêm tài khoản Google vào app. Một cửa sổ Chrome trắng mở ra, bạn đăng nhập như bình thường, app nhận ra ngay khi xong và tự đóng cửa sổ hộ bạn. App không bao giờ đụng tới mật khẩu — nó chỉ mở cửa sổ và đứng đợi.
Mỗi tài khoản có một thư mục Chrome riêng, nên nhiều tài khoản chạy song song được: đo thật trên Windows 11, 8 cửa sổ Chrome khởi động hết 8,2 giây, mỗi cửa sổ chiếm 0,6–1 GB RAM, máy 16 GB chịu được khoảng 13 cửa sổ cùng lúc.
Dự án, giấy phép và video xuất ra nằm trong thư mục dữ liệu của app trên máy bạn, không nằm cạnh file chạy — nên cài đè lúc cập nhật không đụng tới công của bạn. Thư mục video xuất ra đổi được trong Cài đặt.
Giấy phép kích hoạt theo mã máy: mua một lần dùng vĩnh viễn, và khi đổi máy thì gỡ giấy phép ở máy cũ rồi kích hoạt lại ở máy mới ngay trong app. Bản cập nhật tải thẳng từ mục Giấy phép, có kiểm tra checksum.

Chức năng chính
- Năm bước từ ý tưởng tới video: chọn mẫu, chọn chủ đề, duyệt kịch bản, dựng video, xuất bản
- Chatbot tự đề xuất chủ đề đáng làm hôm nay, hoặc bạn tự gõ chủ đề của mình
- Ép thời lượng video từ 30 đến 180 giây, hoặc để chatbot tự quyết
- Khai kiểu giọng cho từng nhân vật để mọi cảnh nói đúng một giọng
- 96 mẫu kịch bản dựng sẵn chia theo chín ngành, còn được bổ sung thêm qua từng bản cập nhật, lọc nhanh và tìm được cả khi gõ không dấu
- Hỏi kịch bản trực tiếp từ Gemini hoặc ChatGPT bằng tài khoản của bạn, không qua máy chủ trung gian
- Bấm một thẻ mẫu là xem thử ngay đoạn video mẫu ấy làm ra, trước khi chọn
- Sinh clip trên Google Flow với bốn model: Omni 1.1 Flash (4/6/8/10 giây), Veo 3.1 Lite, Fast và Quality
- Dựng ảnh từng cảnh bằng Nano Banana và duyệt trước mắt, không trừ credit, rồi mới biến ảnh thành clip
- Ba bậc model ảnh: Nano Banana Pro, Nano Banana 2 và Nano Banana 2 Lite
- Ảnh tham chiếu sản phẩm dùng chung: tải một lần, gắn tối đa 4 ảnh cho mỗi dự án để AI không vẽ sai mẫu
- Bàn dựng cảnh: xem trước từng cảnh, sửa prompt, tạo lại đúng cảnh đó thay vì dựng lại cả video
- Năm nguồn giọng đọc: Edge, CapCut, Piper và VieNeu chạy trên máy, ElevenLabs bằng khoá của bạn
- Phụ đề khớp từng từ, burn thẳng vào video, chọn được vị trí và kiểu chữ
- Bảng ước tính credit trước khi dựng: video này cần bao nhiêu, các tài khoản còn bao nhiêu
- Xoá watermark của Gemini và Veo trên clip, ảnh đã sinh (đầy đủ trên bản Windows)
- Chạy nhiều cửa sổ Chrome song song, mỗi tài khoản Google một thư mục riêng
- Thư viện thành phẩm trong app: xem lại, tải về, mở thư mục video, mở lại dự án để xuất bản bản mới
- Công cụ Text to Speech riêng: dán kịch bản hoặc nhập .txt/.srt, chọn giọng, nhận tệp tiếng
- Khôi phục tài khoản Google đã có trên máy khi mất danh sách tài khoản
- Nền sáng và nền tối, giao diện tiếng Việt và tiếng Anh, nhớ kích thước cửa sổ
- Cập nhật ngay trong app, tải từ máy chủ bản quyền và kiểm checksum trước khi chạy
Công nghệ sử dụng
Python 3.14 + FastAPI + pywebview + Playwright (Chromium) + ffmpeg, đóng gói bằng PyInstaller và Inno Setup
Hình ảnh giao diện
1 / 29
Lưu ý
- Giá gốc 1.500.000đ, hiện giảm còn 1.000.000đ.
- Giấy phép vĩnh viễn: mua một lần, dùng mãi, được cập nhật miễn phí cho tới khi ngừng bán.
- Mỗi giấy phép kích hoạt trên một máy. Đổi máy thì gỡ giấy phép ở máy cũ rồi kích hoạt lại ở máy mới, làm ngay trong app.
- App không thu thêm đồng nào sau khi mua. Credit sinh video là credit gói Google AI Pro hoặc Ultra của chính bạn.
- CMSNT không giữ tài khoản Google của bạn: bạn tự thêm và tự đăng nhập, app không bao giờ chạm tới mật khẩu.
- Thư mục Chrome của mỗi tài khoản bị ghim vào máy tạo ra nó, không chép sang máy khác được — đổi máy nghĩa là đăng nhập lại.
- Đường sinh clip đi qua giao diện web của Google Flow. Google đổi giao diện thì cần một bản cập nhật; app tải cập nhật ngay trong mục Giấy phép.
- Chức năng xoá watermark hiện đầy đủ trên Windows; bản macOS chưa có công cụ native cho phần này.
- Do đặc thù sản phẩm số — khoá giấy phép được bàn giao và có thể sử dụng ngay sau khi thanh toán — chúng tôi KHÔNG hoàn tiền sau khi giấy phép đã được cấp, trừ trường hợp lỗi kỹ thuật thuộc về sản phẩm mà chúng tôi không khắc phục được trong thời gian hợp lý.
- Chính sách dịch vụ: xem tại đây.
Sẵn sàng tự động hoá công việc kiếm tiền online?
Nhắn tin cho CMSNT để được tư vấn mã nguồn phù hợp, xem demo chi tiết và setup miễn phí lần đầu.