cd /news/artificial-intelligence/top-ai-papers-on-hugging-face-2026-0… · home topics artificial-intelligence article
[ARTICLE · art-81847] src=dev.to ↗ pub= topic=artificial-intelligence verified=true sentiment=· neutral

Top AI Papers on Hugging Face - 2026-07-31

Hugging Face's top AI papers for July 31, 2026, highlight a shift from models that merely respond to those that can act, remember, self-optimize, and operate in complex environments. The list includes Qwen-UI-Agent for GUI automation, PhiZero for world modeling with physical language, Metis as a memory foundation model, Frontis-MA1 for AI4AI, DistillAlign for video generation distillation, and AskChem for chemistry claim extraction.

read7 min views1 publishedJul 31, 2026

Hôm nay, danh sách paper được upvote cao trên Hugging Face cho thấy một bức tranh rất rõ về hướng đi của AI hiện đại: từ mô hình chỉ “trả lời” sang mô hình có thể hành động, ghi nhớ, tự tối ưu và làm việc trong thế giới phức tạp hơn.

10 bài báo dưới đây trải dài từ GUI agent, world model, memory foundation model, đến video generation, RLHF/token-level optimization, và AI for science.

Bài viết này sẽ tóm tắt cho từng paper theo 4 góc nhìn:

2607.28227

LLM ngày càng giỏi ngôn ngữ, nhưng khi phải thao tác giao diện thực — app, web, desktop, mobile UI — chúng thường kém ổn định. Các GUI agent hiện nay gặp khó ở việc hiểu màn hình, lập kế hoạch thao tác nhiều bước, và thích nghi với giao diện đa dạng ngoài đời.

Qwen-UI-Agent hướng tới một foundation agent cho GUI, tức một mô hình có thể nhìn giao diện, hiểu mục tiêu của người dùng, rồi chuyển thành chuỗi hành động như click, nhập text, cuộn, chọn menu.

Điểm đáng chú ý là paper đặt trọng tâm vào real-world centric: không chỉ benchmark trong môi trường sạch, mà nhắm tới những tình huống giao diện thực tế, nhiều nhiễu, nhiều biến thể. Điều này rất quan trọng vì GUI agent chỉ hữu ích khi vượt qua được “khoảng cách demo và sản phẩm”.

2607.28624

Nhiều world model hiện học từ hình ảnh/video nhưng khó nắm bắt quy luật vật lý theo cách con người diễn đạt: đẩy thì vật lăn, va chạm thì đổi hướng, vật nặng rơi nhanh theo trực giác mô tả.

PhiZero xây dựng world model xoay quanh khái niệm physical language — tức biểu diễn và suy luận về thế giới vật lý bằng một dạng “ngôn ngữ vật lý” có cấu trúc. Thay vì chỉ dự đoán pixel tiếp theo, mô hình cố gắng học các quan hệ và quy luật có tính vật lý.

Điểm mới nằm ở việc gắn world modeling với language-like abstractions cho vật lý. Đây là hướng rất đáng quan tâm, vì nếu AI hiểu thế giới bằng các khái niệm trừu tượng hơn pixel, nó sẽ:

2607.26760

LLM truyền thống có context window lớn hơn trước, nhưng context không phải memory. Mô hình vẫn thiếu khả năng ghi nhớ dài hạn, truy hồi thông tin liên phiên, và duy trì tri thức cá nhân hóa theo thời gian.

Metis đề xuất một Memory Foundation Model — mô hình nền tảng được thiết kế xoay quanh chức năng nhớ. Thay vì coi memory là tiện ích gắn ngoài, paper xem memory như thành phần cốt lõi của kiến trúc và quá trình huấn luyện.

Điểm mới là đưa memory từ vai trò “RAG phụ trợ” thành first-class capability. Nếu làm tốt, đây là bước chuyển rất lớn: từ chatbot stateless sang tác nhân có lịch sử, kinh nghiệm và sở thích người dùng được duy trì lâu dài.

2607.28568

Một trong những mục tiêu lớn của AI research là xây dựng hệ thống có thể giúp cải thiện chính quy trình phát triển AI: viết code, chạy thí nghiệm, sửa lỗi, tối ưu pipeline, đọc log, đề xuất thay đổi.

Frontis-MA1 là mô hình theo hướng AI4AI — AI để xây AI. Trọng tâm của paper là huấn luyện hệ thống có khả năng hỗ trợ hoặc tham gia vào recursive self-improvement trong machine learning engineering.

Khác với coding assistant thông thường, paper hướng đến vòng lặp:

Đây là bước tiến từ “code completion” sang research/engineering agent.

2607.26811

Trong video generation, distillation giúp tạo model nhỏ hơn/nhanh hơn. Tuy nhiên, distillation thường gặp trade-off:

Hai mục tiêu này thường kéo nhau theo hai hướng khác nhau.

DistillAlign tìm cách phối hợp hai động lực trên trong quá trình chưng cất mô hình video tự hồi quy. Mục tiêu là giữ được cả độ đa dạng lẫn độ trung thành/chất lượng.

Điểm mới nằm ở cách “align” giữa mode covering và mode seeking thay vì chỉ tối ưu một phía. Đây là vấn đề rất thực tế trong generative modeling, vì model nhanh nhưng kém đa dạng thì vô dụng, còn đa dạng mà thiếu ổn định cũng khó dùng.

2607.28618

Văn liệu hóa học tăng rất nhanh, khiến nhà nghiên cứu khó tổng hợp tri thức từ hàng nghìn paper. Vấn đề không chỉ là tìm tài liệu, mà là trích xuất và tổ chức các claim khoa học.

AskChem xây dựng hạ tầng claim-centered cho chemistry literature synthesis: lấy “kết luận/khẳng định khoa học” làm đơn vị trung tâm, thay vì chỉ mục bài báo hay embedding đoạn văn.

Đây là hướng rất phù hợp với khoa học thực nghiệm. Nhà khoa học thường quan tâm:

Paper nhấn mạnh cấu trúc tri thức ở cấp claim, hữu ích hơn nhiều so với semantic search thuần túy.

2607.25659

Tối ưu LLM bằng reinforcement learning thường dựa trên reward ở mức câu trả lời hoàn chỉnh. Nhưng nhiều lỗi thực ra xuất hiện ở mức token hoặc đoạn sinh cục bộ, khiến tín hiệu học quá thô.

CoRT đề xuất counterfactual replay kết hợp với token-level rubric-guided optimization. Hiểu đơn giản, mô hình được đánh giá tinh hơn ở cấp token/đoạn dựa trên rubric, rồi dùng các biến thể phảnfactual để học xem thay đổi cục bộ nào dẫn đến kết quả tốt hơn.

Điểm mới là chuyển reward modeling từ mức “đầu ra cuối cùng” sang mức chi tiết hơn, có hướng dẫn bằng rubric. Điều này có thể giúp training ổn định hơn và cải thiện những hành vi như lập luận, format, tuân thủ chỉ dẫn.

2607.27380

Video generation hiện tạo ra hình ảnh đẹp hơn nhiều, nhưng vẫn hay mắc lỗi về tính nhất quán vật lý: vật thể xuyên nhau, chuyển động vô lý, quỹ đạo không ổn định.

VideoCoCo dùng Code-as-CoT — tức biểu diễn chuỗi suy nghĩ điều khiển bằng code hoặc cấu trúc gần-code — trong một agentic dual-engine system. Một engine có thể phụ trách lập kế hoạch/logic, engine còn lại sinh video theo kế hoạch đó.

Điểm đáng chú ý là kết hợp:

Đây là dấu hiệu cho thấy video generation đang chuyển từ “mô hình sinh thuần” sang “hệ thống có planner”.

2607.25675

Một khó khăn khi huấn luyện mô hình reasoning là ai chấm điểm cho lời giải? Nếu rubric yếu, mô hình học lệch; nếu solver yếu, tín hiệu phản hồi cũng kém.

DecoEvo đề xuất để solverrubric-generator cùng tiến hóa. Một bên sinh lời giải, bên kia cải thiện khả năng tạo tiêu chí/chấm điểm, và hai bên hỗ trợ nhau.

Ý tưởng co-evolution trong không gian văn bản khá thú vị vì nó biến quá trình tối ưu thành hệ sinh thái nhiều vai trò, thay vì một mô hình đơn độc tối đa hóa reward cố định.

2607.25294

Đánh giá multimodal model hiện nay thường rời rạc: benchmark này đo grounding, benchmark kia đo QA, benchmark khác đo tri thức. Ta thiếu một bộ đánh giá xem mô hình học từ ngữ cảnh đa phương thức tốt đến đâu.

CLBench-V xây dựng benchmark đánh giá quá trình từ grounding đến knowledge acquisition trong bối cảnh multimodal. Nói cách khác, mô hình không chỉ nhận diện hình ảnh, mà còn phải dùng ngữ cảnh để hình thành hiểu biết mới.

Điểm mới là xem context learning như năng lực trung tâm, nối perception với reasoning/knowledge. Đây là hướng rất cần thiết cho các tác nhân đa phương thức trong môi trường mở.

Nếu nhìn tổng thể, có 4 xu hướng lớn:

Các paper như Qwen-UI-Agent, Frontis-MA1, VideoCoCo cho thấy AI không chỉ sinh text mà còn phải:

MetisPhiZero đại diện cho hai năng lực từng bị xem nhẹ trong làn sóng LLM đầu tiên:

Đây có thể là nền tảng cho agent bền vững hơn và thông minh hơn.

CoRTDecoEvo cho thấy cộng đồng đang tìm cách vượt qua reward thô sơ. Tương lai của alignment có thể nằm ở:

AskChemCLBench-V nhấn mạnh rằng AI muốn hữu ích thật sự thì cần:

Top paper hôm nay phản ánh một giai đoạn rất thú vị của AI research. Trọng tâm không còn chỉ là “model lớn hơn”, mà là model hữu dụng hơn:

Nếu phải chọn các hướng đáng theo dõi nhất trong vài tháng tới, mình sẽ ưu tiên:

Đây là những mảnh ghép có thể đưa AI tiến gần hơn tới các general-purpose agents thật sự hữu dụng trong đời sống và công việc.

Nếu bạn muốn, tôi có thể tiếp tục chuyển bài này thành:

── more in #artificial-intelligence 4 stories · sorted by recency
── more on @hugging face 3 stories trending now
sponsored brought to you by zahid.host 4,200+ EU-deployed projects
reading about agents? ship yours in a single git push.

Run your AI side-project on zahid.host

EU-based hosting, git-push deploys, automatic HTTPS, no cold starts. Free tier with a custom domain — perfect for shipping the agent you just read about.

$git push zahid main
Live at https://your-agent.zahid.host
Get free account → Pricing
from €0/mo · no card required
LIVE [news/top-ai-papers-on-hug…] indexed:0 read:7min 2026-07-31 ·