Mình hay nhắc đến Ollama và trước cũng từng dùng Ollama để thử nghiệm mấy mô hình be bé. Mới đây bài viết có tiêu đề Friends Don't Let Friends Use Ollama đã nêu ra lý do tại sao không nên sử dụng Ollama nữa. Thật sự là không ngờ rằng có nhiều lý do đến như thế. Sau khi đọc xong, thấy ngoài việc họ khá "chùy" trong việc ghi thêm nguồn llama.cpp - vốn là động cơ chính để chạy các mô hình ngôn ngữ lớn thì còn một lý do cũng đáng lo ngại nữa là dịch vụ Cloud thiếu tính minh bạch.
À mới đây cũng có vụ khai thác lỗ hổng tràn bộ nhớ nữa cũng nguy hiểm phết 🫣
Nếu đã sử dụng rust-analyzer trong VSCode để làm LSP cho Rust thì mới đây, một người nào đó đã chế ra Rust Glancer để làm điều tương tự nhưng sử dụng ít ram hơn tới 100 lần 😱
Công cụ này đã có trên Marketplace Rust Glancer, các bạn có thể dùng thử xem thế nào ha ☺️
Mọi người đang bàn tán rất xôn xao trước thông tin GPT‑6 Astra chính thức được OpenAI cho ra mắt.
Astra đạt điểm số 99,9% trong ARC-AGI-3 và 100% trong ExploitBench, 98% trong FrontierMath Tier 4, đã giúp giải quyết nhiều vấn đề tồn đọng lâu năm trong toán học. Nói ngắn gọn thì Astra đã vượt qua mức hiệu quả hành động cơ bản của con người ở mức 96%, nhìn chung chẳng khác gì một người bình thường. Nghe quen quen nhỉ, đúng rồi, đó chính là AGI (Artificial General Intelligence) trong truyền thuyết đấy mọi người.
Nhiều người cho rằng điểm số 99.9% của Astra thực chất có được là nhờ OpenAI sử dụng bộ khung (responses API harness) tối ưu hóa riêng. Khi chạy với bộ khung trung lập của ban tổ chức bài kiểm tra, Astra chỉ đạt khoảng 62% - 62.7%. Chỉ số Trí tuệ của Astra trên Artificial Analysis chỉ đạt 61 điểm, xếp ngang Grok 4.6 hay GPT-5.6 Sol và thậm chí đứng sau cả Opus 5 . Nói chung điểm số chỉ phản ánh được một phần thôi chứ không nên tin tưởng tuyệt đối vào quảng cáo như thế được.
Một lần nữa thông tin trên có thể khiến một số người cảm thấy áp lực và vô nghĩa khi phải liên tục học hỏi các framework hay công cụ mới, vì chúng có nguy cơ bị lỗi thời chỉ sau vài tháng. Nhiều lập trình viên lo ngại sâu sắc về tương lai nghề nghiệp của mình trước sự ra mắt dồn dập của các mô hình mới ngày càng hoàn thiện hơn. Chưa kể nếu chúng rơi vào tay "kẻ xấu" thì nhân loại sẽ như thế nào đây 😩
Ơ, quay ra quay vô tưởng chỉ có mình Codex sập. Hóa ra sập tập thể luôn rồi, Claude, xAI cũng đi rồi các ông ạ.
Gemini thì vẫn sống khỏe, mấy nhà cung cấp bên Trung hình như cũng không bị ảnh hưởng. Thắc mắc là tại sao lại sập tập thể nhỉ? Chắc do AWS hoặc Cloudflare rồi 🥶
Một bên là nhà sản xuất chip, một bên là nền tảng lưu trữ hàng triệu mô hình AI. Chà, sắp tới chúng ta sẽ có sản phẩm gì đây 😱
Không thấy ai nhắc gì luôn á, làm mình cũng quên. Độ mấy tuần trước Meta cho ra mắt công cụ Agents Code Muse Code, kèm theo các họ models Muse Spark dành riêng cho nó. Mình có dùng thử Muse Spark 1.2 nhưng không thấy ấn tượng nhiều cho lắm, chắc chưa để nó giải quyết công việc thường ngày nên chưa thấy nhiều giá trị.
Cuối tuần trước Muse Code thoát khỏi mác thử nghiệm (beta) để đi vào phiên bản ổn định, hôm nay Meta tiếp tục cho ra Muse Spark 1.3 với điểm số cực kỳ ấn tượng, vượt xa bản tiền nhiệm 1.2 trước đó.
Chà chắc phải dùng thử phát xem sao 😁. Muse Code bán gói gia hạn hàng tháng rồi, khởi điểm chỉ có 5$ thôi mà nghe đâu mỗi 5h được 10-50 request lận
Sáng sớm đọc tin Anthropic cho ra Claude Fable 5.1 and Claude Mythos 5.1, bổ sung thêm vào 2 mô hình cao cấp nhất của họ thì tối lại đọc tiếp tin Google cho ra Introducing Gemini 3.8 Flash and 3.8 Flash Cyber - 2 mô hình tiếp theo thuộc nhánh Flash - tức cân bằng giữa hiệu năng và giá cả.
Hình như Google đang liên tục cho ra các mô hình giảm tải gánh nặng tài chính cho người dùng thay vì tập trung vào phân khúc cao cấp như các dòng Pro như trước đây hay sao 🤔? Hoặc cũng có thể đang ém hàng siêu to khổng lồ để sau này đùng một cái... bất ngờ chưa? 😅
À quên không nói mặc dù là Flash nhưng điểm hiệu năng không hề kém cạnh với cái tên Opus đâu đấy nhé 😎
Chả là thế này, mình có thói quen chống trì hoãn bằng cách cố gắng... phơi ra trước mắt hoặc để trong tầm với.
Đôi khi có nhiều việc cần làm, muốn làm nhưng nhiều lúc bị chen ngang bởi suy nghĩ có việc khác quan trọng hơn cần ưu tiên làm trước. Rồi ngày qua ngày vẫn cứ thế, việc định làm thì chưa làm được nhưng trong đầu thì vẫn đinh ninh sẽ làm, chỉ có điều sẽ là bao giờ?
Thế là cứ phải để cho nó đập vào mắt mình, hay cực đoan hơn là làm cho nó cản trở công việc khác thì may ra mới đụng đến. Mấy nay lười đọc sách, mà bên cạnh đã để hẳn một chồng dự sẽ đọc rồi ấy chứ, có điều chỗ đặt nó ngay ngắn quá vô tình trở nên tàng tình trong mắt. Hôm vừa rồi mình đặt hẳn một cuốn ra trước mặt. Giữa chỗ bàn phím với 2 cánh tay đặt trên mặt bàn để gõ phím, thế là vô tình cuốn sách trở thành một cái gì đó vướng víu nhưng nhất quyết không bỏ ra. Thế là nó cứ nằm ì một chỗ, lâu lâu nhìn xuống lại như thấy nhắc "cầm lấy và đọc tôi đi". Ấy thế mà có hiệu quả thật 😆
Người ta kháo nhau JavaScript/TypeScript mới là ngôn ngữ "ruột" của LLM vì đây là nguồn dữ liệu dồi dào nhất dùng để đào tạo các mô hình ngôn ngữ lớn. Mới đây Google đăng một bài viết có tiêu đề Why Go is an Ideal Language for AI-Assisted Software Engineering để giải thích lý do tại sao Go mới là ngôn ngữ lý tưởng để cộng tác cùng với trí tuệ nhân tạo.
Cũng dễ hiểu thôi bởi vì Go có triết lý thiết kế đơn giản, hiệu năng cao, cái gì cũng có khả năng làm được và hơn nữa rất dễ tiếp cận. Các bạn nghĩ sao về lý do mà họ đưa ra ở trên? Cá nhân mình thấy Go rất đáng dùng, tuy nhiên lại chưa thử kết hợp nó với AI để xem có đúng như lời đồn không nữa 😁
Chợt nhận ra là chưa có bài viết nào nhắc đến Qwen3.8 27B - đây là mô hình cỡ vừa và nhỏ tiếp theo được Alibaba cho ra mắt như họ đã hứa, nối tiếp sự thành công của Qwen3.5.
Nếu như bạn chưa biết thì trên mạng mọi người truyền tai nhau về việc Qwen3.5 làm mô hình chạy cục bộ để lập trình tương đối tốt, nó cân bằng giữa hiệu năng và tốc độ, đủ để làm một số tác vụ lập trình cơ bản. Phiên bản 3.8 lần này tiếp tục khẳng định điều đó, tuy nhiên số lượng tham số không đa dạng như trước nhưng bù lại nó có kích thước hợp lý để chạy trên nhiều thiết bị người dùng sở hữu.
Mình chưa có nhiều cơ hội thử trải nghiệm phiên bản này nhưng có vẻ nó đang được chú ý nhiều phết!